ChatGPT功臣发布非语言模型Jev:只输出概率不出文本

科技/AI
前OpenAI研究员、RLHF技术发明者Diogo Almeida创办的TypeSafe AI发布新模型Jev。它基于transformer架构却并非大语言模型,不输出文本,只给出概率,也就是公司所说的校准决策,因而不会产生幻觉。其输出token免费,输入token按十亿计费。上线后API一度被开发者挤爆。Vercel工程师实测,替换OpenAI模型后速度快5至18倍且更准确。
ChatGPT功臣发布非语言模型Jev:只输出概率不出文本

ChatGPT的核心构建者之一、RLHF(基于人类反馈的强化学习)训练方法的发明者Diogo Almeida,两年前离开OpenAI,创办了TypeSafe AI。这家公司本周发布的新模型Jev,走的是一条与主流相反的路。

Jev基于transformer架构,却不是大语言模型。它不生成文字,只输出概率,公司称之为校准决策。用户需要预先定义好输出结果,模型只负责判断输入落在哪一类,因此它基本不会产生幻觉。

成本结构同样反常:输出token免费,输入token按十亿计费,而不是按百万计费。产品上线后,TypeSafe的API一度因为访问量过大而无法正常提供服务。

让Almeida失望的不是别的,正是自己参与打造的ChatGPT。他向TechCrunch形容,手里握着一只装着闪电的瓶子,可它并不好用,这个问题困扰了他很久。

想通之后的结论是:行业一直在优化人类语言。四年下来,模型把人类语言做得非常出色,但对自动化没什么用,因为计算机说的是另一种语言。

RLHF是当年把ChatGPT从“会补全文本”变成“能对话”的关键一步,也被视为这一轮AI浪潮的分水岭。Almeida的判断是,这条路线在自动化场景里已经碰到天花板。

两年前他离开OpenAI,创办TypeSafe AI,目标就是这个缺口。Jev是这家公司给出的第一个答案。

最先被Jev吸引的是写代码的人。Vercel的软件工程师Pranit Sharma说,公司原本用OpenAI的ChatGPT Luna 5.6跑一个分类器,用于审查指令是否安全。

把Luna换成Jev后,速度提升5到18倍,准确率也更高。Vercel做的是智能体基础设施,这类高频调用对延迟和成本都很敏感。

Bryo AI首席技术官Nikhil Mudholkar则拿Jev与Gemini对比,测试商务邮件分类。Gemini准确率略高,成本却是Jev的10到20倍。

更让他看重的是置信度分数。按他的说法,Jev是少数会返回真实概率的模型,这让工作流自动化有了可依赖的判断依据。

Jev既可以替代部分大语言模型的工作,也能给它们做检查。用智能体监控智能体,费用很容易滚起来,换成Jev来做就便宜得多。

Almeida设想的用法包括追踪大模型智能体的行为轨迹、拦截越狱尝试。这类任务只看结果落在哪一类,不看话说得漂不漂亮。

Earendil首席技术官Armin Ronacher(该公司开发开源模型框架Pi)认为,这相当于把幻觉问题交还给用户:返回概率只有50%,就当抛硬币,直接忽略;到了95%,才值得动手。

Ronacher还看好模型路由。判断一项任务该派给哪个模型,本身就是一次决策;用大语言模型来干太贵,Jev的便宜和速度能支撑实时分拣。

杰文斯悖论来自19世纪经济学家William Stanley Jevons:某种商品的成本下降,消耗量反而会上升。

Almeida把赌注押在这个逻辑上——智能的单位成本降下来,铺开的规模会远超今天。

他描述的未来是到处都有聪明的小软件,形态涌现而分散,更像早期互联网,而不是各家争相打造的超级应用。

TypeSafe对架构守口如瓶,外部观察者怀疑Jev建在一个开放权重的语言模型之上。公司把Jev叫作“系统一号模型”,强调它偏重直觉而非推理,只做特定任务。

训练数据全部是合成的,方法被Almeida命名为“基于校准决策的强化学习”。他说这是个很早就下的赌注,所有数据都自己造,是他这辈子最好的赌注之一,比产品发布、比RLHF都要好。

公司一半的体量是一个实验室,掌握着统计上可解释的合成数据这一分支。Almeida称这是他现在最大的乐趣所在。

同类模型目前只有Jev一个,Ronacher预计竞争者会迅速出现。他的解释是,大语言模型又便宜又有补贴,大家此前没有动脑的必要。

TypeSafe会继续推出新版本,覆盖新的模态。被问到公司算不算前沿实验室,Almeida的回答是:前沿实验室的主要产品是恐惧或者炒作,他希望自家的主要产品是智能。

过去几年,整个行业押注同一个方向:把模型做大,把语言能力做强,把数据中心一座座盖起来。这条路催生了ChatGPT,也把账单推得一天比一天高。

Jev把“判断”和“表达”拆开了。分类、路由、安全审查这些活本来就不需要文采,却一直在用按百万token计费的模型硬扛。

输出免费、输入按十亿计价,说明它瞄准的是高频、量大、结果确定的场景。此前创业者不敢放进循环里的AI调用,现在有了跑起来的可能。头部厂商被绕开的,恰恰是那些最不值钱、却最占调用量的部分。

Ronacher那句“大语言模型又便宜又有补贴”,点出了竞争的底色:不是技术做不到替代,而是没有人有动力去做——直到有人做了。

短期受益的是基础设施公司和中型团队,压力留给了把语言能力当作唯一卖点的模型供应商。这一形态能否成为标配,取决于头部厂商是否愿意跟进。Jev真正证明的是,智能未必需要会说话。

大四那年的合租房,对铺的室友接了份数据标注的零活。整晚的工作是把几千条用户评论点成“正面”“负面”“无效”,屏幕右下角的计时器滴答走,一条好像只值几毛几分。凌晨三点,那人揉着眼睛说过一句:等以后机器自己会看就好了。这次看到Jev把输出token做成免费、输入按十亿称重,心里先冒出来的不是速度,是当年那些一条条数出来的东西——原来可以按“十亿”这个单位来计算。省下的开销当然好,可那些按条计价的手指,往后该按什么计价?