Asta Lab · 全栈情报站AI FULL-STACK INTELLIGENCE每日 · 全栈 · 精选

AstaNews

AI 全栈每日情报

CEO-Bench:500 天创业模拟测试 AI 商业决策,仅三模型盈利

CEO-Bench 的设计理念来自对现有 AI 评测的一个观察:大多数 benchmark 测量的是单次推理的准确率,而现实商业决策要求的是跨越数百轮的策略一致性、资源管理和动态调整。500 天创业模拟的核心挑战不是单个决策的对错,而是能否在资源约束下保持正收益。 普林斯顿团队设计的模拟包含市场动态、竞争压力、融资决策、人员管理等多个维度,模型需要在不完整信息下持续做决策,并承受之前决策的累积后果。500 天相当于约 500 轮决策周期,是目前 LLM agent 评测中周期最长的之一。 结果分层明显。Fable 5 以 $47.15M 排第一,Opus 4.8 $27.8M 第二,GPT-5.5 $21.3M 第三——三款均为当前头部闭源旗舰模型。第四名是规则启发式系统,$15.76M。其余所有测试模型均亏损。这个排序说明:旗舰模型的能力差距在长周期决策中依然显著,但同时也说明大多数次旗舰模型在这类任务上的策略泛化能力不足以超越简单规则。 规则启发式以 $15.76M 胜出多数 AI 的结果值得独立分析。规则系统的优势在于一致性:它不会因 prompt 变化而飘移,不会在某些情境下过度冒险,也不会陷入分析瘫痪。而大模型在长决策链中的弱点之一是缺乏稳定的风险偏好函数——在不同语境下的风险容忍度可能发生漂移,导致策略不一致。 对 agent 应用开发者来说,这个结果的启示是:长周期决策任务不应单纯依赖模型的泛化能力,而应考虑将规则约束与模型推理混合使用。尤其是资源分配、风险控制等强结构化子任务,规则层的稳健性往往优于纯模型决策。 局限:CEO-Bench 的模拟环境与真实商业场景的差距是不可忽略的变量——模拟中的市场动态是否真实反映了创业决策的核心挑战,决定了这个评测的外部效度。$47.15M、$27.8M 等数字是模拟货币单位,不代表真实盈利规模。具体实验设计细节尚未完整披露,结论的泛化程度需待论文发表后进一步验证。