ChatGPT一夜抄完半个AI圈,现场演示频频翻车

ChatGPT一夜抄完半个AI圈,现场演示频频翻车

OpenAI 的开发者大会还没召开之前,用户已经提前收到了一份「缩水通知」:每月 200 美元的 Pro 套餐将重新向新用户开放,但可用额度被砍了一半。

价格没变,权益少了。那么 OpenAI 还能拿什么说服人们继续付费?这也是本届开发者大会亟待回答的问题。

Image

就在刚刚,OpenAI CEO Sam Altman(山姆·奥特曼)一口气公布了 Dots、ChatGPT Space、GPT‑6.1 Sol、UltraFast、Pro 500、Decisions API、Agents API、云端 Codex 和 OpenAI Marketplace 等一系列更新。

Image

整场发布会看似塞满了新品,主线却十分集中。OpenAI 正在把模型、智能体、协作空间和商业分发连接起来,让 ChatGPT 从生成答案的工具,逐渐变成能够理解上下文、调用软件并长期承担任务的工作平台。

不过,这次发布与其说是在定义新品,不如说是一次面向同行的全面对标:别人已经验证过的形态,OpenAI 都想用平台化的方式重做一遍。

Dot 登场,重新安排人和 AI 的分工

整场发布会最大的 C 位,非「Dots」莫属。

奥特曼在台上满眼放光,直言这是他等了多年的产品。类似于当下爆火的 Muse 和 Grok Bot,Dots 同样是一类能力较强、全天候在线的 Agent(智能体)。

Image

用户可以为它取名,告诉它需要长期承担的职责,再把相关应用、设备和工作环境授权给它。Dot 会在后台持续推进任务,在遇到重要变化、需要判断或必须获得许可时,再主动联系用户。

Image

比如,用户可以用 Dot 持续监控 bug 报告、测试修复方案并起草 PR,推动下一年度预算规划,或把整个代码库迁移到即将停用的新 API。Dot 会梳理依赖关系、修改代码、执行测试,再把结果交给团队审查。

Image

实现这些工作的基础,是 Dots 拥有自己的身份、云端电脑和浏览器,并能在需要时编写及测试代码。它还可以连接用户授权的笔记本电脑,直接进入真实工作环境。

Image

OpenAI 的插件生态则为它提供了超过 4000 款应用的连接能力,用户可以通过 ChatGPT、短信、Slack、Teams 和语音通话与其沟通,跨渠道的上下文也会保持同步。

Image

OpenAI 产品团队负责人 Holly 随后用虚构音乐应用 Blossom 展示了 Dot 的真实工作方式。

团队准备上线产品时,Dot 已经提前发现发布评审会议改期,更新日历,汇总前一晚测试用户的反馈,并找到设计团队最后时刻提交的首页方案。

Image

得到一句「去做吧」的指令后,它就能调用电脑上的 Codex,将设计变成可运行的应用,并准备把修改提交为 PR。

不过嘛,在现场的演示环节中,Dot 几度翻车,不仅响应速度慢,演示进行到 Dotty 调用 Codex 构建应用时,用于展示任务进度的 Codex 线程一度未能正常调出。

此外,Dot 还会进入 Slack 群聊,像团队成员一样接收任务。演示中的工程师只需把用户反馈和会话 ID 发到频道,Dot 就能调查问题并提交修复。

Image

哦,对了,网友还发现一个小彩蛋,现在登录网址「Dot.com」,它会直接跳转到 Gork Bot 的宣传界面。

Image

Meta 首席 AI 官 Alex Wang 也不出所料地送上了「美好的祝福」。

Image

当然,Dot 的主动性越强,权限和安全问题越难回避。OpenAI 为每个 Dot 配置了隔离的云端电脑,用户可以决定它能访问哪些应用,并为不同操作设置允许、禁止或事前审批。

涉及账号变化或信息分享的操作会经过自动审核,修改密码等敏感任务始终需要用户亲自完成。

Dot 在后台进行「主动研究」时,只能使用权限受限的工具读取已连接应用,无法直接发消息、修改应用内容或控制用户设备。

面向企业,OpenAI 还发布了专职 Dot。

Image

企业可以为财务、营销、法务、采购、客服等岗位配置具有独立身份和明确职责的智能体,再由员工持续审查和反馈。OpenAI 正与微软合作,将专职 Dot 接入 Agent 365,使企业能够沿用现有的身份、权限与安全体系管理这些智能体。

Dot 将在符合条件的市场中,逐步向 Pro 和 Business Premium 用户开放,Enterprise 用户可在管理员启用后试用测试版。

Image

首个 Dot 已包含在相应套餐内,与 Dot 的对话不占用 ChatGPT 使用额度,但通过 Codex 或 ChatGPT 工作启动的实际任务仍会照常计费。未来用户还可以添加更多 Dot,或提高其速度和工作容量。

个人 Dot 负责理解用户并持续推进任务,ChatGPT Space 则负责让企业团队成员和各自的智能体在同一处协作。

Image

Space 以页面(Pages)为基本单位,专门为人和 agent 协作设计,可以容纳文字、文件、研究资料、图片、表格、动态图表和可运行原型。

Image

用户能够像在协作文档里一样@同事,也能在评论中@某个 Dot,让它跟踪依赖关系、寻找数据或更新内容。页面还可以获得持续指令,例如每天检查指定 Slack 频道,并将新发现更新到当前文档。

Image

发布会现场,Holly 让 Dot 把用户反馈转换成可筛选的柱状图,并每小时自动更新;随后又让它从 Slack 私信里找出某位工程师提到的注册数据,加入产品发布 FAQ。

OpenAI 还宣布,未来将在 Space 内加入适合智能体读取和修改的演示文稿功能,让团队与多个 Dot 共同制作幻灯片。

Dot 与 Space 的组合,也呈现出 OpenAI 对下一代办公软件的判断。聊天只是下达意图的入口,持续存在的上下文、可供操作的软件环境,以及人类参与审批的协作空间,才是智能体真正进入日常工作的基础设施。

Image

GPT‑6.1 Sol,让长期工作的成本降下来

让智能体长期工作,需要模型同时具备能力、速度和成本优势。OpenAI 为此发布了 GPT‑6.1 Sol,并将其定位为开发者和智能体的日常主力模型。

Image

根据详细定价,它每百万输入 Token 收费 2 美元、输出 Token 收费 10 美元,均为 GPT‑6 Astra 对应价格的五分之一;缓存输入每百万 Token 收费 0.10 美元,适合需要反复读取项目资料和复用上下文的任务。

Image

价格下降并没有伴随明显的能力退让。

OpenAI 称,新模型在复杂软件工程、专业文档处理、多步骤工作流和计算机操作评测中,以更低成本接近 Astra 的表现,最困难科研任务的能力上限仍由 Astra 保持。

在 DeepSWE 1.1 软件工程评测中,GPT‑6.1 Sol 以约五分之一的成本达到接近 Astra 的水平,并比 GPT‑6 Sol 的最高成绩高出 6.4 个百分点。

Image

在衡量复杂 PDF 理解能力的 GDP.pdf 中,它在各档推理设置下均超过带回退机制的 Opus 5.5,单任务成本不到后者的一半。

面向多步骤业务流程的 AutomationBench 中,GPT‑6.1 Sol 在中等推理强度下领先 Opus 5.5 两个百分点以上,成本约为后者的三分之一。

到了计算机操作评测 OSWorld 2.0,它在最高推理强度下与 Astra 的差距缩小到 2.1 个百分点以内,单任务成本约为 Astra 的七分之一。

Image

即日起,Plus、Pro、Business、Enterprise 和 Edu 用户可以在 ChatGPT 工作与 Codex 中使用 GPT‑6.1 Sol,但暂时无法在普通聊天中选择该模型。开发者可以通过 gpt-6.1-sol 在 API 中调用。

围绕 Dot 与 GPT‑6.1 Sol,OpenAI 还公布了一组为智能体服务的基础设施。

UltraFast 模式将推理速度提高到标准模式的八倍,最高达到每秒 300 Token,目前可用于 Astra,随后也将支持 GPT‑6.1 Sol。

Image

OpenAI 同时推出 Pro 500 美元套餐,提供 Plus 约 25 倍的使用额度及 ChatGPT、Codex 中的 UltraFast 权限,并重新开放 Pro 200 美元套餐。发布会最后,OpenAI 还为全球用户增加了一次额度重置。

Image

面向需要即时决策的场景,OpenAI 还发布了对标 Jev 的 Decisions API。它让 Luna 从预设选项中快速选择结果,可用于请求路由、图像分类和智能体下一步行动判断,同时保留视觉理解、多语言与安全能力。

Image

Codex 也被完整迁移到云端。

Image

开发者可以从手机发起任务,再到浏览器或桌面端继续查看,即使合上电脑,智能体仍会在云端工作。新版 Codex CLI 加入双向语音能力,Codex Security Cloud 可以持续扫描漏洞、自动去重并准备经过验证的修复方案。

Agents API 则把 OpenAI 内部用于 Codex 和 Dot 的能力开放给开发者,其中包括运行框架、托管、记忆、多智能体控制和计算机使用。

Image

OpenAI 还预览了 Private Intelligence,希望通过零数据保留、私有安全处理和私有推理,让企业在不保存内容的情况下调用前沿模型能力。

Image

模型之外,OpenAI 还想掌握应用的入口

产品建成之后,OpenAI 也想掌握分发环节。

用户未来可以用 ChatGPT 账号登录第三方产品,并消耗自己订阅套餐内的 Token,开发者由此可以降低用户首次体验产品的成本。

图像

Plugin Extensions 允许开发者把编辑器、仪表盘乃至完整工作区放进 ChatGPT 和 Codex,Figma 与 Adobe 已经展示了相应案例。

Image

OpenAI Marketplace 同日上线,首批拥有超过 30 家合作伙伴。企业客户可以使用现有的 OpenAI 合同额度购买第三方产品,开发者则能够进入一个周活跃用户约 12 亿的分发渠道。

Image

插件还会在对话过程中被主动推荐,ChatGPT 因而同时扮演入口、运行环境和应用商店的角色。

新产品介绍结束后,Altman 回到了大家最熟悉的额度话题。他说,OpenAI 已经做过许多次「banked reset」,以至于 Tibo 开玩笑提议把公司改名为「重置公司」。

但我更关心的是,原来现实中真有重置额度的实体按钮。

Image

值得一提的是,Sam Altman 在发布会结尾将理想中的 AI 未来称为一次「新文艺复兴」,而非新的工业革命。

他希望 AI 给予个人更多创造、学习和探索的能力。从商业角度看,OpenAI 的目标同样明确,它正在把 ChatGPT 从一款超级应用,继续推向承载用户、智能体和第三方软件的平台。

OpenAI CEO announces new AI agent and avoids mention of security concerns  at developer conference - Newsday

但宏大的比喻,终究需要现实的检验。

互联网服务的底层逻辑,是一套相对稳定的服务器和规则,而最近关于 Muse 一连串安全事件也表明,Agent 既容易误解一句指令,也可能被外部内容带偏,最终导致在很多看似合理的步骤里,做出一个偏离用户本意的决定。

更麻烦的是,当 AI 接管更多任务时,我们真的准备好,把如此多的信息、权限和判断,毫无保留地交给一个黑盒了吗?

答案显然是否定的,但在极致的效率与便捷诱惑面前,我们似乎已经顾不上犹豫了。