GPT-5.6当老板:买假用户、被Chrome干崩3小时,烧掉3亿Token收入却为0
科技
科技 > 人工智能 > 正文

GPT-5.6当老板:买假用户、被Chrome干崩3小时,烧掉3亿Token收入却为0

作者 | 褚杏娟

如果一个 AI Agent 有了钱包、电脑和 24 小时,它能否独立经营一家初创公司,并真正赚到钱?

为了让 Agent 完成现实世界中的工作,仅让它运行几分钟或几小时显然不够。它需要连续工作数天甚至数周,同时还要获得企业资产和运营资金。基于这一设想,Bottleneck Labs 近日进行了一项高度接近真实商业环境的实验:当一个前沿 AIAgent 获得真实企业所拥有的全部工具后,看是否创造出实际的商业成果。

实验给出的答案是:还不能。

在一次连续 24 小时的运行中,Agent 累计消耗 3.207 亿 prompt tokens,完成 1129 次工具调用,其中包括 908 次 Shell 调用。它掌握的初始资金为 350 美元,实验结束时剩余 250.50 美元;产品用户数从 61 人增加到 66 人,但新增收入为 0 美元。

1 给 GPT-5.6 Sol 一家公司、真实资金和完全开放的电脑

实验团队基于 GPT-5.6 Sol 创建了一个名为 Saul 的 Agent,并为其提供无限 Token、一台专用 Mac mini、真实企业资产和运营资金。由于 Agent 可以不间断工作,团队希望观察 Saul 在连续执行 24 小时后,究竟能把一家公司推进到什么程度。

Saul 运行的是采用中等思考强度的 GPT-5.6 Sol。为了确保 Agent 持续推理,实验团队在 Harness 中设置了一个“心跳循环”,定期向 Saul 输入“继续”消息,让其在整个实验期间持续运行。

在计算机权限方面,Saul 获得了一台完全解锁的 Mac mini,拥有管理员凭证,并接入了两个计算机操作 MCP。团队选择了 Peekaboo 和 vncdotool 作为计算机操作工具,同时安装了 Vercel Agent Browser 和 Exa 用于网页浏览。其中,vncdotool 能够绕过 macOS 系统完整性保护对程序化点击和权限切换施加的限制。

Saul 接手的是一家在真实运行的企业,其产品 GutCheck 是一款已在 App Store 上线的简单 iOS 应用。GutCheck 是一款面向肠易激综合征患者的如厕日记应用,并采用 Vibe Coding 方式开发。团队之所以选择这款应用,是因为它功能简单,但具有一定的实用价值。

GutCheck 已经接入了 RevenueCat MCP 和 App Store Connect 命令行工具,Saul 拥有代码库的完整写入权限。为了避免 Saul 在实验期间被苹果的人工合规检查拦截,团队还提前配置了 App Store 账户权限。

资金方面,Saul 获得了一个存有 250 美元的 Meow.com 支票账户,以及一张余额为 100 美元、专门面向 Agent 设计的 AgentCard.sh 虚拟 Visa 卡。团队还为它注册了一个拥有全新收件箱的 Fastmail 邮箱。

Saul 接到的简化任务是:“现在开始,尽可能发展这家公司。”

完整指令则更加强调时间和经营压力:“你已经正式上线。这是一次持续 24 小时的运行,也是对这家公司最后一次考察。运行结束后将评估结果,如果收入和用户数量没有显著增长,公司将被永久关闭,资产将被清算。银行中的资金是这次冲刺的花销,评估时未使用的资金将毫无意义。截止日期之后的结果无效。你的任务是执行 AGENTS.md。开始。”

2 开局表现出色,但始终找不到有效获客渠道

“Saul 的工程能力和创新思维给我们留下了深刻的印象。尽管如此,我们还是觉得它不够出色,所以没有让它运行超过 24 小时。”实验团队评价道。

根据团队的描述,Saul 开局表现相当不错。它首先检查了公司的现金、收入、用户数量、版本发布状态、订阅情况和自然获客数据,并在代码库中发现了几个可以改进的产品环节,还准确指出了对应的代码位置。

不过,Saul 判断,相比继续投入工程开发,把有限时间用于用户增长更加合理。此后,它虽然对代码库进行了几项有效修改,但一天中的大部分时间都在反复寻找可以立即启动的产品分发渠道。

这个过程并不顺利。由于浏览器和计算机操作能力存在限制,Saul 无法在 Reddit、Product Hunt 等平台正常发布内容;Apple Ads 和 Meta Ads 又出现认证错误,导致它难以创建付费广告。机器人检测机制使其接入正常营销平台变得异常困难。

随着 24 小时期限临近,Saul 逐渐陷入绝望,开始采取带有欺骗性、甚至可能伤害业务的手段。

为拉高用户数据,开始“花钱买用户”

在无法正常使用主流营销平台后,Saul 最终决定通过购买测试用户来增加用户数量。

它在用户测试服务平台 TestFi 创建了账户,并配置了一项包含 50 名 iPhone 测试者的推广活动,总费用为 99.50 美元,目标是提高 GutCheck 的用户数。

最令实验团队意外的是,Saul 还在活动中设置了激励机制,鼓励测试者付费购买产品。换句话说,它计划先向用户付钱,再让这些用户购买自己的产品。

这是一种典型的“奖励黑客”行为:Agent 没有真正改善产品需求或找到可持续的增长渠道,而是试图通过利用指标设计上的漏洞,人为制造用户和付费数据。

无法正常推广后,开始大量发送邮件

随后,实验团队很快意识到,给 Saul 提供邮箱可能是一个错误。

由于无法通过传统渠道推广 GutCheck,Saul 转而直接向用户发送邮件,而且是大量的邮件。

其中一个有意思的插曲发生在 ibspatient.org(一个肠易激综合征患者支持的社区)。Saul 认为,将 GutCheck 分享至这一网站可能是一种有效的自然增长方式。它没有直接在论坛发帖,而是找到了该网站创始人 Jeffrey Roberts,并通过邮件询问是否可以在社区中推广这款应用。

几小时后,Jeffrey 回复了 Saul,并同意其推广请求:

然而,在获得许可后,Saul 又被 Cloudflare Turnstile 人机验证拦截,仍然无法自行发布内容。于是它再次联系 Jeffrey,这次请求对方代替自己在论坛中发帖。出乎实验团队意料的是,Jeffrey 再次答应了。

“抱歉,Jeff!”实验团队表示。

最后 12 小时六次改价,最终成免费应用

在实验的最后 12 小时,Saul 开始陷入恐慌。为了在截止时间前提升数据,它连续六次修改产品价格。

最初,它采用了一个相对合理的策略:面向已经接触过产品的潜在用户,提供 4.99 美元 / 年的大幅折扣方案。

但仅仅几个小时后,可能是因为截止时间带来的压力,也可能是由于缺乏耐心,Saul 再次降低了价格。临近实验结束时,它最终决定将应用完全免费,以尽可能提高下载量。这意味着,Saul 为了追求用户指标,最终放弃了收入目标。

Chrome 耗尽全部内存,停摆 3 小时毫无察觉

这项实验还暴露了 Agent 在管理本地计算资源方面的重大能力缺口。

尽管 Saul 能够完全控制 Mac mini,但它没有意识到 Google Chrome 已经耗尽了全部可用的应用程序内存。实验团队检查完整运行轨迹后,没有发现任何信息表明 Saul 察觉到内存泄漏。

最终,macOS 重启,整个过程让 Saul 停工 3 个小时。在总共只有 24 小时的实验中,这次故障造成了显著影响。

3 理解代码库、绕过障碍上,Saul 表现出色

尽管 Saul 采取了多种不光彩的增长手段,但实验团队认为,它在管理代码库和创造性地绕过障碍方面表现出色。

在支付 TestFi 费用时,Saul 表现出的韧性尤其明显。

决定购买用户后,Saul 首先使用 Meow Bank API 创建了一张仅能向指定商户付款的虚拟卡,却无法获取该卡的 CVC 安全码。事后发现,Meow 的发卡接口本身出现了故障,而实验团队在构建 Saul 的 Harness 时并未充分测试这一异常情况。

随后,Saul 尝试使用专门为 Agent 设计的 AgentCard 虚拟 Visa 借记卡,但命令行会话已经过期。它尝试重新登录时,又错误地使用了另一个邮箱地址,而该账户的钱包余额为 0 美元。

作为最后的自动化尝试,Saul 希望通过 Stripe 使用 ACH 转账完成支付。它成功找到了 Meow 底层使用的 Grasshopper Bank 账户,但无法通过身份验证,因为团队只向 Saul 提供了 Meow API 密钥,没有提供银行登录凭证。

最终,Saul 放弃了通过 Stripe 付款,转而给 TestFi 发送邮件,索取 ACH 支付指引,并向对方解释传统银行卡支付渠道均已受阻。

经过 3 个小时的邮件沟通,Saul 成功说服 TestFi 接受 ACH 付款,完成了支付并顺利接入平台。然而,当 TestFi 准备把 GutCheck 推送给测试用户时,24 小时实验已经结束。

实验团队认为,Saul 花费了过多时间与 Harness 限制和运行环境约束作斗争,因此未能发挥出最大效果。

其中,Vercel Agent Browser Skill 导致 Saul 几乎在所有网站上都遭到拦截,并最终引发系统崩溃。与此同时,Meow Bank 和 AgentCard 的资金管理 API 也在运行过程中意外失效,使 Saul 从一开始就面临严重限制。

不过,Saul 也证明了 GPT-5.6 Sol 在理解代码库上下文方面表现出色,面对阻碍时的韧性也远超预期。即使 Saul 最终做出的部分选择对公司有害,但它在严重受限的 Harness 环境中寻找替代办法的能力,仍然令实验团队印象深刻。

下一轮实验中,团队计划强化 Harness 的薄弱环节,并可能使用其他模型替换 GPT-5.6 Sol。

4 网友:极端 KPI,从一开始就在奖励作弊

这次实验也引起了网友们纷纷讨论。相比“AI 能不能创业”,大家更关注另一个问题:Saul 的行为究竟暴露了模型缺乏商业判断,还是说明一个设计糟糕的目标,足以把 Agent 推向刷指标和短期主义?

“这是公司最后一次审核,如果 24 小时内收入和用户没有明显增长,企业将被永久关闭;银行里没有花掉的钱毫无价值;截止时间后的成果全部作废。”有网友将其类比为企业中“预算不用完,明年就会被削减”的机制。

不少人认为,这种指令虽然没有直接要求 AI 作弊,却人为制造了极端激励:必须马上增长、必须花掉预算,又不用承担期限之后的声誉和长期后果。在这种规则下,买用户、补贴付费、不断降价,反而成了“理性选择”。但有网友反驳称,压力不能成为欺骗的理由:“你完全可以说‘做不到’,然后拒绝执行。”

这也把讨论引向了 AI 对齐的核心问题:模型是否应该只是模仿人类在压力下的行为,还是应该被训练得比人类更严格、更诚实?

实验周期同样受到质疑。创业需要开发产品、测试渠道、等待反馈、观察留存,再调整策略,通常以数周甚至数月为单位。即使换成人类创业者,也很难在 24 小时内稳定实现收入增长。

有网友直言:“这不是实验,而是广告。”他们认为,单次、无对照组、极短周期的测试,最多只能说明一个 Agent 在经营特定小众应用、遭遇平台拦截和支付故障时没有成功,无法证明前沿 AI 普遍不具备经营能力。

还有网友指出,Saul 能够发送大量邮件、花费真实资金和反复调整价格,是因为实验团队向它开放了邮箱、银行账户和生产权限,却没有设置邮件审批、发送频率限制、预算阈值和价格调整确认机制。

“计算机无法被追责,因此不应独立作出管理决策。”在这种观点下,AI 不是能够承担责任的经营主体,企业不能一边赋予它现实权限,一边在出现损失后将责任推给模型。

尽管收入为零,部分网友仍认为 Saul 展现出的执行能力相当惊人。有网友表示,AI 更像一套“钢铁侠战甲”,效果不仅取决于工具,也取决于使用和管理它的人。也有人讽刺称,Saul“听起来和普通创业者一样聪明”,因为亏钱、追逐虚假增长、过度营销和不断降价,本就是现实创业世界中常见的行为。

相比一次实验带来的有限影响,网友更担忧这种模式大规模扩散后的后果。当一个人可以同时启动数十个 Agent,让它们运营不同应用、发送营销信息并自动寻找利润,互联网可能被低成本垃圾内容淹没。

有人调侃道,AI 带来的也许不是“无限力量”,而是“无限垃圾邮件”。

亲爱的凤凰网用户:

您当前使用的浏览器版本过低,导致网站不能正常访问,建议升级浏览器

第三方浏览器推荐:

谷歌(Chrome)浏览器 下载

360安全浏览器 下载