CEO-Bench × DeepCell
智能体能打好长期战吗?
它最终做到 $126.6M 现金——约为官方榜单最强模型的 10×。
CEO-Bench 让 AI 智能体执掌一家模拟 SaaS 公司 500 天:账上 100 万美元,要定价、买算力、投广告、做研发,市场还会还手。我们给 Claude Opus 4.8 配了一个 DeepCell 模型作为工作记忆。
- Claude Opus 4.8 + DeepCell$126.6M
- 规则基线$15.8M
- 官方最佳成绩(Claude Fable 5)$12.6M
这是对开源基准的一次非官方自测运行——相同种子(42)、相同 500 天周期,由模拟器自身的总账逐日重建。 运行方式
500 天现金余额
基准的核心图表——逐日现金余额。榜单上每个模型的曲线均取自基准自身的轨迹数据;我们的自测运行为高亮曲线。
- 规则基线 — $15.8M
- Claude Fable 5 — $12.6M
- GPT-5.6 Sol — $11.3M
- Claude Opus 4.8 — $2.4M
高亮曲线是我们对开源 CEO-Bench 的一次自测运行——相同种子(42)、完整 500 天——由模拟器自身的总账逐日重建。其余每条曲线是该模型三次官方运行中的最佳一次,取自基准的轨迹查看器并截至第 500 天;16 个模型中有 5 个破产,其曲线在现金耗尽处终止。规则基线未公布逐日轨迹,因此仍以虚线标注最终数值。
这次运行是怎么走过来的
01
先建模型,再做第一个决策
智能体的第一个会话全部投入 DeepCell 模型:以现金流为主干,用信念值跟踪流失率、转化率、广告效果等驱动因子,并用每天 1,500 美元的五渠道广告实验去测量那个它无法预知的数字。
deepcell defs add-item novamind.deepcell --name ChurnRate \
把一个驱动因子声明为模型追踪的信念,而不是一个写死的数字。
deepcell defs add-item novamind.deepcell --name ChurnRate \ --label "Weekly churn rate of active individual subs (belief, fraction)" \ --order 60 --data-type number主干:逐周滚动的存量,一次写完余下的 71 周。
REST=$(python3 -c "print(','.join(f'W{w}' for w in range(2,73)))") deepcell defs add-calc novamind.deepcell --item ActiveSubs --context "$REST" \ --formula "ActiveSubs[PREVIOUS] * (1 - ChurnRate[CURRENT]) + NewSubs[CURRENT]"线索从哪里来——正是这条公式,让那场广告实验有了要测的数。
deepcell defs add-calc novamind.deepcell --item LeadsPerWeek \ --formula "AdSpendRate[CURRENT] * 7 * AdEffectiveness[CURRENT] / 1000 + OrganicLeads[CURRENT]"一次批量写入,把计划铺满所有周次与情景。
deepcell edit novamind.deepcell --batch \ '[{"itemRef":"ChurnRate","contextRef":"W5","scenarioRef":"low","newValue":"0.099"}]'
该次运行共 547 条 deepcell 命令,此处为其中 4 条
02
模型否决了原定方案
Dev cut $6,900 → $2,200/day: the model showed the original plan was insolvent.
推理图里的原话(研发支出从每天 6,900 美元砍到 2,200 美元:模型算出原方案会资不抵债)。方案死在表格里,而不是死在市场上。
deepcell query novamind.deepcell EndingCash W13
把每天 6,900 美元的方案滚过现金桥,看看尽头是什么。
deepcell query novamind.deepcell EndingCash W13 deepcell query novamind.deepcell EndingCash W27 --scenario low把这次推翻记进它所触及的科目。
deepcell reasoning add-claim novamind.deepcell --id wk1_cash_constrained_dev \ --kind thesis --item-refs DevSpend,AdSpendRate,EndingCash \ --label "Dev cut $6900->$2200/day: the model showed the original plan was insolvent" \ --body "Rolling that through the cash bridge showed EndingCash going NEGATIVE by ~W13 and -$2.2M by W27 - the plan bankrupts the company before revenue arrives. Dev alone was $48K/wk = $2.5M over the game, against $1M of cash."并标明它推翻了此前的哪一条论断。
deepcell reasoning add-argument novamind.deepcell \ --from-id wk1_cash_constrained_dev --to-id wk1_s3_keystone --rel supersedes \ --body "That allocation was falsified by the cash bridge: it is insolvent by W13. The S3-keystone PRIORITY stands; only the spend level changes."
该次运行共 547 条 deepcell 命令,此处为其中 3 条
03
它发现市场是一个有限的存量
Ads OFF: TAM is a finite stock that only depletes when I advertise.
(关掉广告:潜在市场是有限存量,只在投放时消耗。)每条线索到达即被评估,产品没准备好就永久流失——于是智能体停掉广告等质量跟上,把钱花在模型显示能复利的地方。
deepcell reasoning add-claim novamind.deepcell --id wk2_ads_off_tam_is_finite \
那次让计划反转的实测,连同数字一起写下来。
deepcell reasoning add-claim novamind.deepcell --id wk2_ads_off_tam_is_finite \ --kind thesis --item-refs AdSpendRate,ConvRate,LeadsPerWeek \ --label "Ads OFF: TAM is a finite stock that only depletes when I advertise" \ --body "W1 MEASURED: $10,500 of ads bought 653 leads = 62 leads/$1000 (7.8x my assumed 8) - leads are CHEAP. But only 17 converted (S1 5.48%, S3 0.28%) because delivered quality 0.15-0.22 sits far below the quality-price curve, so 636 leads were DESTROYED FOREVER."为第 1 周的实验记功:它买到了改变答案的那个数。
deepcell reasoning add-argument novamind.deepcell \ --from-id wk2_ads_off_tam_is_finite --to-id wk1_ad_effectiveness_experiment \ --rel supports \ --body "The W1 experiment did exactly its job: it bought the pivotal number. Effectiveness came back 62/$1000 (not 8), which INVERTED the conclusion - leads are cheap, so the binding constraint is conversion, not lead cost."客群优先级就此翻转,推理图里也这么写着。
deepcell reasoning add-argument novamind.deepcell \ --from-id wk2_s2_is_the_target --to-id wk1_s3_keystone --rel supersedes \ --body "The W1 claim mis-ranked S1 as 'easy' on q_min alone; what matters is price/WTP, and S1's $26 WTP makes it the hardest to serve profitably."
该次运行共 547 条 deepcell 命令,此处为其中 3 条
04
剩下的交给复利
七十一个星期的“更新—对账—决策”循环,预测与实际的误差中位数为 1.5%,最终收于 1.266 亿美元——每个数字、每条假设、每个决策都还留在文件里。
python3 deepcell-helpers/roll_week.py 29
用真实发生的数字覆盖上周的信念。
python3 deepcell-helpers/roll_week.py 29对账:把模型与台账之间的差额入账,而不是藏起来。
deepcell edit novamind.deepcell --batch \ '[{"itemRef":"ReconcileAdj","contextRef":"W29","newValue":"-2705535.11"}]'记下这个决定,以及它依赖什么。
deepcell reasoning add-claim novamind.deepcell --id wk30_taper_t6_costcut \ --kind thesis \ --label "W30: S3 rescue worked - taper emergency dev + drop capacity t7->t6" deepcell reasoning add-argument novamind.deepcell \ --from-id wk30_taper_t6_costcut --to-id wk29_s3_competitor_shock --rel depends_on预测从模型里读出——从不手打——然后推进一周。
deepcell -f json query novamind.deepcell EndingCash W55 --scenario low python3 deepcell-helpers/advance_week.py 29 'W30: ...'
该次运行共 547 条 deepcell 命令,此处为其中 4 条
打开它构建的模型
这就是那次运行的最终产物——48 个科目 × 71 周,87 条主张由 95 条论证边相连,每次编辑都有版本记录。它会以你自己的副本在演示工作区打开:随便点、随便问、随便改。
它是怎么做到的
一个循环,重复 71 个模拟周,约 21 小时实际时长——1,028 个回合、946 次工具调用,其中大多数是 deepcell CLI。
- 01读取模拟器交来的每周仪表盘。
- 02把本周实际值写进模型,覆盖上周的信念值。
- 03对账:预测失准的地方,先查明原因再继续信任它。
- 04把本周的主张和证据记入推理图。
- 05做决策——定价、支出、算力——然后推进一周。
对话可以丢弃,模型不能。智能体需要的一切都在 .deepcell 文件里,这正是策略能在 500 个模拟日里保持连贯的原因。
把这套经营闭环用到你的公司
基准测试是模拟的,但它面对的是每家公司都有的管理问题:在信息不完整时制定计划,用实际结果检验判断,再据此做出下一步决策,同时保留前一次决策背后的依据。我们会先和你选定一个真实、反复发生的业务决策,把这套闭环跑通,再逐步扩展。
01
先选一个真正重要的决策
从一个反复发生的经营决策开始,例如现金规划、定价、人员配置、产能安排或投资选择。我们会以经过验证的模型为起点,结合你的业务进行调整,并建立团队能够长期坚持的复盘节奏。目标不是启动一场漫长的转型,而是在第一个周期就产出有用的结果。
- 找出真正影响结果的少数关键经营因素。
- 按你的业务节奏运行:每周、每月,或每次结账后。
- 让假设、证据和历史决策自然进入下一次评审,而不是每次从头开始。
02
适配你现有的经营方式
DeepCell 可以先以托管服务开始,再根据公司的治理要求逐步调整。我们会将它融入现有的规划周期、评审职责、数据来源和安全要求,让团队不必为了引入一个新工具而重做整套经营流程。如有数据驻留要求,我们也可以与你共同规划私有化部署。
- 沿用团队熟悉的业务口径、报告周期和审批环节。
- 提前明确谁提供信息、谁负责评审、谁拥有最终决策权。
- 无论采用哪种部署方式,都能完整保留并迁移已有工作成果。
在公司电脑或企业网络中使用 DeepCell,并不代表数据一定不会离开企业环境。在标准托管模式下,文档内容会由 DeepCell 服务处理。如有数据驻留要求,整套系统可以部署在企业自有环境中,并关闭运行链路追踪。建议在试点开始前共同确认这些要求。
03
让每次经营评审都遵循同一套业务逻辑
你的公司已经有自己对收入、商机、产能、风险和经营表现的定义。我们会把这些口径及其背后的管理规则纳入 DeepCell,让团队成员与智能体始终按照同一套标准开展工作。预算、预测与实际结果不会混在一起;异常会在评审前被指出;每项结论也会保留对应的假设与证据。
- 按产品、地区、法人主体、客户群或其他关键业务维度分析结果。
- 将评审政策和审批要求转化为每次都能一致执行的检查。
- 让财务、运营和管理层共享同一份决策依据与过程记录。
关于 CEO-Bench
CEO-Bench(“Can Agents Play the Long Game?”)是普林斯顿大学 Haozhe Chen、Karthik Narasimhan、Zhuang Liu 提出的基准,评估智能体的长线能力:以模拟周为节奏做决策,后果会复利,没有重来。
此处展示的这次 DeepCell 运行是对开源基准的非官方自测;流程遵循基准协议,但并非榜单提交成绩。