CEO-Bench × DeepCell

智能体能打好长期战吗?

它最终做到 $126.6M 现金——约为官方榜单最强模型的 10×

CEO-Bench 让 AI 智能体执掌一家模拟 SaaS 公司 500 天:账上 100 万美元,要定价、买算力、投广告、做研发,市场还会还手。我们给 Claude Opus 4.8 配了一个 DeepCell 模型作为工作记忆。

  • Claude Opus 4.8 + DeepCell$126.6M
  • 规则基线$15.8M
  • 官方最佳成绩(Claude Fable 5)$12.6M

这是对开源基准的一次非官方自测运行——相同种子(42)、相同 500 天周期,由模拟器自身的总账逐日重建。 运行方式

500 天现金余额

基准的核心图表——逐日现金余额。榜单上每个模型的曲线均取自基准自身的轨迹数据;我们的自测运行为高亮曲线。

  • 规则基线$15.8M
  • Claude Fable 5$12.6M
  • GPT-5.6 Sol$11.3M
  • Claude Opus 4.8$2.4M

高亮曲线是我们对开源 CEO-Bench 的一次自测运行——相同种子(42)、完整 500 天——由模拟器自身的总账逐日重建。其余每条曲线是该模型三次官方运行中的最佳一次,取自基准的轨迹查看器并截至第 500 天;16 个模型中有 5 个破产,其曲线在现金耗尽处终止。规则基线未公布逐日轨迹,因此仍以虚线标注最终数值。

这次运行是怎么走过来的

  1. 01

    先建模型,再做第一个决策

    智能体的第一个会话全部投入 DeepCell 模型:以现金流为主干,用信念值跟踪流失率、转化率、广告效果等驱动因子,并用每天 1,500 美元的五渠道广告实验去测量那个它无法预知的数字。

    deepcell defs add-item novamind.deepcell --name ChurnRate \

  2. 02

    模型否决了原定方案

    Dev cut $6,900 → $2,200/day: the model showed the original plan was insolvent.

    推理图里的原话(研发支出从每天 6,900 美元砍到 2,200 美元:模型算出原方案会资不抵债)。方案死在表格里,而不是死在市场上。

    deepcell query novamind.deepcell EndingCash W13

  3. 03

    它发现市场是一个有限的存量

    Ads OFF: TAM is a finite stock that only depletes when I advertise.

    (关掉广告:潜在市场是有限存量,只在投放时消耗。)每条线索到达即被评估,产品没准备好就永久流失——于是智能体停掉广告等质量跟上,把钱花在模型显示能复利的地方。

    deepcell reasoning add-claim novamind.deepcell --id wk2_ads_off_tam_is_finite \

  4. 04

    剩下的交给复利

    七十一个星期的“更新—对账—决策”循环,预测与实际的误差中位数为 1.5%,最终收于 1.266 亿美元——每个数字、每条假设、每个决策都还留在文件里。

    python3 deepcell-helpers/roll_week.py 29

打开它构建的模型

这就是那次运行的最终产物——48 个科目 × 71 周,87 条主张由 95 条论证边相连,每次编辑都有版本记录。它会以你自己的副本在演示工作区打开:随便点、随便问、随便改。

数字本身

收入、支出、期末现金逐周排开——先写信念值,实际值落地后覆盖,出现偏差就对账。

看看内部

带凭证的决策

主张图是智能体的决策日志:它相信什么、哪些证据改变了它、每条主张支撑了哪些决策。

看看内部

整张网络

所有科目、计算和主张在同一张依赖图里——一条流失率信念如何一步步连到现金行。

看看内部

熊市、基准、牛市

智能体把 95% 置信区间维护成活情景,每次预测都自带误差范围。

看看内部

它是怎么做到的

一个循环,重复 71 个模拟周,约 21 小时实际时长——1,028 个回合、946 次工具调用,其中大多数是 deepcell CLI。

  1. 01读取模拟器交来的每周仪表盘。
  2. 02把本周实际值写进模型,覆盖上周的信念值。
  3. 03对账:预测失准的地方,先查明原因再继续信任它。
  4. 04把本周的主张和证据记入推理图。
  5. 05做决策——定价、支出、算力——然后推进一周。

对话可以丢弃,模型不能。智能体需要的一切都在 .deepcell 文件里,这正是策略能在 500 个模拟日里保持连贯的原因。

把这套经营闭环用到你的公司

基准测试是模拟的,但它面对的是每家公司都有的管理问题:在信息不完整时制定计划,用实际结果检验判断,再据此做出下一步决策,同时保留前一次决策背后的依据。我们会先和你选定一个真实、反复发生的业务决策,把这套闭环跑通,再逐步扩展。

  1. 01

    先选一个真正重要的决策

    从一个反复发生的经营决策开始,例如现金规划、定价、人员配置、产能安排或投资选择。我们会以经过验证的模型为起点,结合你的业务进行调整,并建立团队能够长期坚持的复盘节奏。目标不是启动一场漫长的转型,而是在第一个周期就产出有用的结果。

    • 找出真正影响结果的少数关键经营因素。
    • 按你的业务节奏运行:每周、每月,或每次结账后。
    • 让假设、证据和历史决策自然进入下一次评审,而不是每次从头开始。
  2. 02

    适配你现有的经营方式

    DeepCell 可以先以托管服务开始,再根据公司的治理要求逐步调整。我们会将它融入现有的规划周期、评审职责、数据来源和安全要求,让团队不必为了引入一个新工具而重做整套经营流程。如有数据驻留要求,我们也可以与你共同规划私有化部署。

    • 沿用团队熟悉的业务口径、报告周期和审批环节。
    • 提前明确谁提供信息、谁负责评审、谁拥有最终决策权。
    • 无论采用哪种部署方式,都能完整保留并迁移已有工作成果。

    在公司电脑或企业网络中使用 DeepCell,并不代表数据一定不会离开企业环境。在标准托管模式下,文档内容会由 DeepCell 服务处理。如有数据驻留要求,整套系统可以部署在企业自有环境中,并关闭运行链路追踪。建议在试点开始前共同确认这些要求。

  3. 03

    让每次经营评审都遵循同一套业务逻辑

    你的公司已经有自己对收入、商机、产能、风险和经营表现的定义。我们会把这些口径及其背后的管理规则纳入 DeepCell,让团队成员与智能体始终按照同一套标准开展工作。预算、预测与实际结果不会混在一起;异常会在评审前被指出;每项结论也会保留对应的假设与证据。

    • 按产品、地区、法人主体、客户群或其他关键业务维度分析结果。
    • 将评审政策和审批要求转化为每次都能一致执行的检查。
    • 让财务、运营和管理层共享同一份决策依据与过程记录。

关于 CEO-Bench

CEO-Bench(“Can Agents Play the Long Game?”)是普林斯顿大学 Haozhe Chen、Karthik Narasimhan、Zhuang Liu 提出的基准,评估智能体的长线能力:以模拟周为节奏做决策,后果会复利,没有重来。

此处展示的这次 DeepCell 运行是对开源基准的非官方自测;流程遵循基准协议,但并非榜单提交成绩。