ChatGPT移动端上线语音智能体,Plus与Pro可直接语音处理工作
OpenAI 周三宣布,将 语音智能体功能 带入 ChatGPT 移动端。用户可以直接开口下达指令,让它起草文档、归纳邮件,或者把零散的待办理成清单。
这项能力并非对所有用户同时开放。ChatGPT 的 Plus 与 Pro 订阅用户在手机上会看到 Work(工作)标签页,可以在里面新建文档、起草邮件、汇总 Slack 消息。
更重一点的活儿也在范围内:搭建网站、制作演示文稿、调用云端浏览器,以及进入财务等板块。免费用户和 Go 档位用户这次拿到的是插件与已连接的应用。
Go 是 OpenAI 价格更低的订阅档位,位置在免费版与 Plus 之间。
语音与文本之间也打通了。OpenAI 表示,语音对话会给出更丰富的文本结果,用户能在说话和打字之间随时换手;在手机上开了头的任务,回到电脑前可以接着做完。
这条产品线铺得并不久。7月,OpenAI 上线对话模型 GPT-Live,随后把它接进桌面端,让 Work 标签页支持用语音完成任务,Codex 标签页支持用语音搭建应用。
此次更新相当于把同一套能力从桌面搬到手机。ChatGPT 的语音功能最早以对话形态出现,用来闲聊、提问、练口语。现在它更像一个入口,一句话丢出去,背后是文档、邮件、浏览器和代码在动。
这也解释了 OpenAI 为什么特意强调“更丰富的文本输出”。说话的带宽很低,一分钟说不了多少字,真正交付的成果仍要落在屏幕上。
移动端与桌面端的衔接是这一轮竞争的焦点。Anthropic 近期让两个平台之间的任务交接更顺,还把 Cowork 与 Chat 的界面并到一起。
OpenAI 的选择相反:聊天与工作区依旧分开,要干活得先切进 Work 标签页。合并界面省掉了找入口的麻烦,分开则让工作这件事有独立的上下文与权限边界。
看这条消息时,我脑子里先排练了一遍:地铁上戴着耳机压着嗓子说,帮我回封邮件,就说周五的会挪到下周。屏幕上大概会一个字一个字长出来,写到一半到站,我下车、上楼、坐下,打开电脑接着往下续。好多年前我也对着手机说过话:站在厨房里,手上沾着面粉,冲它喊“十分钟”,一遍没听懂,第二遍懂了,我居然觉得挺神,那时候语音只会干这一件事。后来它坏了,我手动设了大半年闹钟,也没觉得少什么。最早那种一句话办成一件事的惊艳,倒比一整套工作流更留得住。也可能只是我记性不好。
完整工作流留给 Plus 与 Pro,免费和 Go 用户只能先碰插件和连接应用,分层很清楚。OpenAI 需要向掏钱的人证明,多出来的月费能换回可量化的时间。
移动端是最适合做这个证明的地方。手机上处理的任务往往碎片、即时、没耐心,语音正好省掉打字那一步;同一个任务回到桌面继续,人又留在了同一套账号体系里。
插件这条线同样有意思。ChatGPT 在2023年就推出过插件系统,后来逐渐被 GPTs 和自建应用盖过,如今又回到免费用户的桌面上。名字没变,含义变了:当年是给聊天加技能,现在是让助手接进你已经在用的工具。
语音能不能真的把手机变成工作台,接下来看两件事:嘈杂环境里识别稳不稳,跨设备续接会不会断。功能已经摆上桌,习惯还得慢慢养。