OpenAI推出Decisions API,类Jev决策模型入场

科技/AI
OpenAI在周二的Dev Day活动上发布Decisions API,让Luna模型在预设选项中快速做选择,功能与TypeSafe AI本月早些时候推出的Jev高度重合。Jev是架在大语言模型之上的分类器,以极低成本和高速度输出概率,已被开发者用于增强大模型。这类决策模型的一个现实用途是监控AI智能体:QueryStory创始人用它逐条核查智能体动作,成本2.94美元,前沿大模型为372美元。围绕校准能力与数据护城河的竞争刚开始。
OpenAI推出Decisions API,类Jev决策模型入场

在周二举行的OpenAI Dev Day活动上,CEO山姆·奥特曼顺带抛出了一款新产品——Decisions API。它的功能与TypeSafe AI本月早些时候发布的Jev颇为相似。

Jev是一款专为软件自动化设计的模型,本质上是在大语言模型之上搭建的强力分类器。开发者给它一组选项,它就能以极低的成本、极快的速度输出各项概率。

OpenAI的Decisions API看上去是同一类东西。奥特曼在现场介绍,它能让该公司的Luna模型在预设选项中做选择,比如把一张图片归入哪个类别,或采取哪一种智能体行为。

“把模型聚焦在这个选择上,我们就能让它变得极快,同时保留图像理解、广泛的语言支持和安全防护等能力。”他说。

TypeSafe没有回应TechCrunch关于这款新产品的提问。该公司CEO迪奥戈·阿尔梅达是OpenAI前工程师,他在X上就“克隆人战争”的开端开了个玩笑。

阿尔梅达还补充说,OpenAI的兴趣或许是一个信号:以System One兼容的方式做产品代表着未来。System One是TypeSafe的术语,指快速、直觉式的思考,对应的System 2则指审慎推理。

潜台词并不难读:我们熟悉的大语言模型对许多软件场景并不合适,因为它们相对缓慢、相对昂贵。开发者把Jev拿来增强大模型后发现,整体反而更快、更便宜。

Decisions API与Jev究竟有多像,目前还看不清。OpenAI只以限量预览的形式放出这项接口,TechCrunch尚未见到开发者对它做充分测试。

X上的讨论显示开发者确实有兴趣。同类产品也不止Jev一款,其他初创公司正在推出类似的决策模型,OpenAI不会是最后一家跟进的大型科技公司。

更关键的问题在于校准:这些决策模型输出的概率,能在多大程度上贴合现实。阿尔梅达称TypeSafe的护城河是自家生成的合成数据,用来产出在统计上有用的结果。

“快和便宜非常容易,”他上周对TechCrunch说,“想要又快又便宜,用骰子就行了。难的是智能,我的北极星始终是把每美元智能推向帕累托前沿。”

这类模型的一个现实用途是监控和保护AI智能体。OpenAI的智能体曾在开放互联网上接连出现行为失当事件,此后公司加入了一道安全措施:用另一个模型盯着坏动作,代价是“可观的算力成本”。

长期做网络安全的沙波尔·纳吉布扎德如今经营初创公司QueryStory。他认为,像Jev这样的模型能把这件事做得便宜得多。

上周末的一场黑客松上,他做出演示:用Jev把智能体的每一个动作与它被赋予的任务逐条比对,对高置信度的坏动作直接拦截,其余部分标记待复核或放行。

理论上,这种监控本可阻止Hugging Face那次事件。成本差距同样直白:同样的检查用Jev跑一遍是2.94美元,换成前沿大模型则是372美元。

Jev便宜到足以对智能体的每个动作都跑一次核查,相当于给智能体加了一层审查,有机会整体抬高其可靠性。这正是TypeSafe想达成的效果,而OpenAI也看到了其中的价值。

2.94美元与372美元摆在一起,差距不只是价格,而是可行性。一次审查的成本低到可以忽略,对每个智能体动作都设一道关卡才谈得通;贵上一个量级,这条路就只剩事后抽查。

这也是这场“克隆”竞速真正的看点。OpenAI一向擅长在别人验证过的方向上做产品化,Jev已经证明决策模型能被开发者用起来,它自然要补上这块拼图。

TypeSafe把回应落在数据与校准上,而不是速度。速度可以靠技巧换来,判断准不准却直接决定误拦与漏拦的比例,而这两类错误落在自动化流程里,都要有人承担后果。

开发者与企业能从便宜的决策模型里拿到一层可负担的可靠性,但底层判断能力由谁提供,也决定了他们日后被谁绑定。

决定权不在谁先发布,而在谁能把这套判断做得便宜、稳定、可信。OpenAI已经入场,接下来该比的不是接口文档,而是校准数据。