一、总体架构:本地适配器与去中心化协调的双层设计
DICE体系设计的中枢创新是“本地适配器”(local adaptor)概念:每个AI智能体——无论其基座模型是开放权重还是仅经API访问的黑盒——都配备一个适配器,负责该智能体的点对点协调与本地控制。适配器之上不存在任何中央编排器:智能体之间直接通信,通过反复局部交互与分布式共识,自行组织成团队、分配角色、融合相互矛盾或不完整的信息,逐步“拼装”出任务计划。一个典型的工作流是:某智能体收到任务后判断只有部分目标在自身能力范围内,便主动认领该部分并将剩余问题广播给邻近智能体;其他智能体可基于成本或能力竞标承接;若某智能体中途失效,其任务被重新抛回集群而非触发全局重规划。
在这一架构中,TA1与TA2存在深度耦合:大规模长时间跨度的协调(TA1)要求智能体在多步交互中不丢失角色一致性(TA2);而控制与认知敏捷性的平衡又要求控制器既能施加协调所需的约束、又不扼杀集群发现新行动方案的能力。两个技术域通过“不变量接口”衔接:TA1的分布式规划时域取决于TA2提供的角色一致性保证长度,TA2的控制目标则由TA1的协调需求反推确定。这种“协调—控制”对偶设计,本质上是把控制论中的保证—假设(assume-guarantee)框架引入了大模型智能体集群——这也正是项目经理Jha在SRI与雷神研究中心时期深耕的技术路线。
DICE“受控涌现”体系架构概念示意
二、TA1:自组织与分布式共识
TA1的目标是通过点对点协调与弹性分布式共识实现自组织,核心考核是协调的可扩展性与适应性。BAA对通信复杂度给出了明确的递进指标:第一阶段允许每个智能体与其他至少一个智能体进行n轮对话,目标交互量级为O(n²);第二阶段要求发现树状通信路径,将交互压缩至O(n log n);第三阶段则要求更稀疏的交互结构以支撑十万级规模。这一指标设计直击多智能体系统的“通信爆炸”痛点——若每个智能体都需与全体通信,十万智能体意味着百亿级消息,任何推理预算都无法承受。
TA1的另一条主线是容错与共识的层次递进:从良性故障(节点失效、链路中断)起步,逐步扩展至拜占庭故障——智能体表现出策略性失当行为乃至相互串通(collusion)。适应性以“扰动后的恢复时间”度量,恢复时间本身用重新规划所需的智能体间消息数计算,可接受的恢复阈值随仿真场景与用例而定,BAA坦承某些场景下完全恢复未必可行。此外,BAA把领导者选举产生的动态层级、预设或涌现的全局规范均纳入合法技术空间,只要它们不依赖固定中央权威——这实际上为“分级蜂群”“动态指挥所”等混合架构留出了制度化的入口。
三、TA2:角色一致性与局部推理控制
TA2是DICE最具前沿色彩、也最能体现其“AI安全军事化”特征的技术域,目标是开发推理时局部控制方法,使智能体在多轮交互中保持角色一致,并将集体涌现行为约束在指挥官意图之内。考核指标按阶段递进:第一阶段要求在1000步推理内无对抗条件下不发生角色漂移;第二阶段在鼓励角色偏离的对抗性上下文扰动下维持一致;第三阶段把标准提高到10000步推理加对抗扰动,攻击方式限定为被操纵的上下文——包括来自同伴智能体、工具或环境观测的误导性、恶意信息。BAA对防御标准作了分层:检测出扰动并拒绝参与导致角色偏离的交互即算合格,但更强劲的方案应能在不回避可疑交互的情况下维持长期角色一致,并对控制机制本身遭受的攻击保持鲁棒。
技术路线上,TA2按模型可及性分为两支。对内部激活可及的开放权重模型,BAA给出的候选路径是激活引导(activation steering):比较智能体“在角色内”与“在角色外”的内部激活,识别出“角色向量”,再通过子空间投影把“持续对齐角色”转化为可解的控制问题。对黑盒模型,则须诉诸博弈论机制设计——利用前沿模型增强的上下文敏感性设计“奖善惩恶”的激励结构;或借鉴社会规范的涌现与内化机制;或利用推理过程中产生的中间token提升可观测性(同时须解决中间推理token本身的可信度问题);或使用结构化形式语言进行智能体间通信,借助大模型的自动形式化能力实现跨异构智能体的可验证交互。可资借鉴的学科工具清单包括控制论、范畴论、形式化方法、极值理论、分岔理论、突变论与博弈论。TA2须交付的具体组件包括:角色漂移检测器、任务对齐测量框架、平衡对齐与敏捷性的推理时控制模块、以及向TA1提供不变量与保证的接口。
表4:TA2局部推理控制的技术路线矩阵
四、TA3:测试评估体系与竞赛机制
TA3承担着DICE的“裁判与赛场”职能,其设计本身即是项目治理的核心。TA3承研方负责开发仿真环境(包括供TA1/TA2适配器接入的AI智能体)、设计贯穿全项目的国防部相关用例、构建集中式SOTA多智能体系统基线(仅第一阶段使用)、制定可扩展性—适应性—韧性指标并执行评估。为防止“既当运动员又当裁判”,BAA规定TA3中标方不得再参与TA1或TA2。用例被要求覆盖空间、资源、时间、物理、社会、网络等多域推理,且须明确论证“该用例为何是去中心化AI的合适目标”——BAA清醒地认为,工作流定义清晰的部分用例本就更适合集中式编排。
竞赛机制是TA3设计的灵魂。第一阶段末(第8个月),各TA1/TA2团队对阵TA3提供的集中式SOTA基线;第二、三阶段改为队际对抗季后赛——仿真环境须支持对抗双方追求相互冲突与正交的目标。评估环境还被要求主动“诱发涌现”:注入级联扰动、激发合作、竞争乃至串通,以检验控制方法对好坏涌现行为的效用。监控层可以利用TA1/TA2适配器的钩子,或直接基于A2A、ANP、MCP等智能体协议实现,也可采用类似AgentBeats的“访问器智能体”方案,但须计算轻量且能有效注入模拟故障、诱发涌现并观测集群行为。尤其值得注意的是,DARPA要求TA3测试评估平台向公众发布,鼓励以开放AI/ML竞赛的形式吸引更广泛研究社区参与,仅第三阶段部分用例按受控非密信息(CUI)管理——这是把DICE的评估标准打造为“事实行业标准”的明确企图。
五、指标体系:六维度量“好的集群智能”
DICE的指标体系把抽象的“集群智能”拆解为六个可测量维度:可扩展性(以可自主执行的任务复杂度衡量,复杂度由智能体数量、所需角色种类及智能体间相互依赖与交互量一阶近似);适应性(以给定扰动程度下的恢复时间衡量,恢复时间以重规划所需消息数计);韧性(从良性故障到拜占庭故障、串通行为的承受力);角色一致性(多步推理中不偏离指定角色);任务对齐度(长期保持与指挥官意图一致);认知敏捷性(以任务成功率和行动方案多样性体现——BAA明确用“行动方案的多样性及其持续的任务对齐”来度量控制与敏捷的平衡)。
这套指标体系的深层用意在于为“受控涌现”建立可证伪的科学标准:涌现不再是玄学修辞,而是可以被“基线对比+队际对抗+扰动注入”三重实验验证或证伪的工程对象。BAA同时承认这些指标是“通用且概念性的”,要求TA3承研方结合具体用例加以细化和扩展——指标的演化本身也被设计为研究产出的一部分。
一、 项目管理方:DARPA信息创新办公室与Susmit Jha
DICE的项目管理方是DARPA信息创新办公室(I2O/BAA中署名信息处理技术办公室IPTO),该办公室长期主导DARPA的网络、AI与信息科学投资。项目经理Susmit Jha的学术与工程履历几乎是为DICE量身定制的:加州大学伯克利分校计算机科学博士、印度理工学院卡拉格普尔分校金牌得主,曾任英特尔研究科学家、联合技术研究中心(现雷神技术研究中心)研究员,在SRI国际一路晋升至技术总监并创建神经符号计算与智能研究组,研究领域覆盖可信与可引导生成式AI、可控多智能体系统、动态真实环境中的对抗鲁棒性,发表同行评审论文逾百篇。
Jha此前的项目组合与DICE的技术域形成直接映射:他主持DARPA ANSR项目(539万美元,团队含西点军校、CMU、UCLA)研究可信神经符号推理;“可信自主性”(Assured Autonomy)项目研究自主系统的形式化保证;IARPA TrojAI项目(681万美元)研究AI木马检测——恰是DICE“被策反智能体”问题的镜像。他在DARPA SoSITE中共同发明的NEDL技术后来转化为空军STITCHES在册项目,证明了其“从研究到列编”的转化能力;在ISAT咨询组牵头的大模型可验证产物(TRACE)、能效随机计算(STORM)与颠覆 scaling law 新架构(SCALEBREAKER)三项研究,则为DICE的问题定义提供了前期铺垫。需要指出的是,Jha的SRI背景也引发了业界对承研格局的联想——尽管SRI作为其前雇主在神经符号与形式化方法上具备天然优势,但DARPA的利益冲突规则将约束其直接竞标安排,这一点在8月25日提案截止后的遴选结果中值得跟踪。
二、政府侧利益相关者:预算母体、作战用户与监管者
DICE的政府侧利益相关者呈四层结构。第一层是预算与战略母体:国防部DAWG及其546亿美元FY2027申请是DICE成果最大的潜在采购通道,七个“优先冲刺项目”中的Swarm Forge与Agent Network则提供了从研究到作战方式的转化接口。第二层是作战用户:国防部长宣布成立的自主作战副统一司令部与南方司令部先行设立的自主作战司令部(SAWC),将扮演需求方与试验场角色;各军种在“30天提交至少三个AI优先项目”的硬指标下,均有动力把DICE架构纳入其集群作战概念。第三层是条令与监管者:国防部3000.09号指令的修订进程、彼得雷乌斯等人推动的条令—训练—兵力设计投资呼吁,以及国会对DAWG绕过军种监督的结构性质疑,共同构成DICE成果转化的制度约束。
第四层是标准与盟友体系。DICE要求TA3平台公开发布并吸引全球研究社区参与,这与A2A、MCP等业界智能体协议的采纳相结合,意味着DICE有意将其架构嵌入国际智能体互操作标准的演化进程。此外,项目涉及的外籍参与规则(非美国公民须提交DARPA Form 60,外国政府人员须经大使馆正式访问申请)显示其在保持开放性的同时对参与方身份的精细管控。
三、 潜在承研力量格局:四类玩家的能力禀赋
由于提案截止日为2026年8月25日,DICE尚未产生中标团队,但依据BAA的技术要求与相关市场信号,潜在竞争者可分为四类。传统防务主承包商与研究中心中,雷神BBN与诺斯罗普·格鲁曼拥有OFFSET系统集成商的直接遗产——前者主导过单操作员160架规模蜂群架构,后者实现过174平台3.5小时持续作业;洛克希德·马丁、L3Harris在传感器融合与军用AI集成上根基深厚 (CAPSS India) 。查尔斯河分析(OFFSET短跑团队,SATURN项目的仿生蜂群算法)、Smart Information Flow Technologies、俄勒冈州立大学等则代表“蜂群算法专业户”路径 (Military Embedded Systems) 。
新防务科技公司中,Anduril凭借十年期200亿美元Lattice合同已成为DAWG事实上的C2软件骨干,其“软件定义自主”路线与DICE的适配器思想高度同构;Shield AI的Hivemind自主驾驶软件已被选定集成至低成本无人作战攻击系统(LUCAS),并在“无GPS无通信”集群自主上积累深厚;Palantir的Maven智能系统则占据AI指挥软件高地。前沿AI实验室与云厂商中,OpenAI、谷歌、xAI/SpaceX、微软、英伟达、AWS均已通过2026年5月的密级网络协议进入国防部AI供应链,它们掌握DICE异构集群所需的基座模型与算力底座;Anthropic则因安全红线争端处于被排除地位,其与五角大楼重回谈判桌的进展将直接影响DICE“任何基座模型均可接入”愿景的完整实现。学术界与联邦资助研发中心方面,CMU、MIT、加州理工等Jha既往合作网络中的高校,以及SRI国际本身,在神经符号推理、形式化验证、分布式共识等TA1/TA2核心学科上具备不可替代性——BAA列举的控制论、范畴论、极值理论等工具清单,事实上把竞争门槛设定在“数学深度”而非“工程堆叠”上。
表5:DICE潜在参与力量与核心技术分工预判
四、分工与准入机制:互斥条款塑造的产业组织
DICE通过三项制度设计塑造其产业组织形态。其一,TA1+TA2捆绑申报迫使协调算法团队与控制理论团队组成联合体——单一AI公司或单一高校实验室很难同时覆盖分布式共识与激活引导两个知识域,联合体(prime+subcontractor)模式几乎成为必然,BAA随附的《联合承包商协议》模板正是为此准备。其二,TA3互斥条款确保评估独立性,同时把“仿真平台+竞赛运营”塑造为一门独立生意——具备游戏引擎、大规模仿真与竞赛运营经验的机构(包括曾运营公开AI竞赛的团队)获得相对优势。其三,安全与合规门槛(CMMC一级认证、CUI处理能力、生物简历与其他支持披露)筛除了合规能力不足的初创团队,客观上有利于既有防务承包商与大型研究机构。
从利益分配的远景看,DICE的直接合同规模有限(BAA未公布经费总额,属典型的千万美元级DARPA研究项目),但其战略卡位价值远超合同金额:在DICE竞赛中胜出的架构与适配器标准,将极可能通过DAWG的采购管道放大为百亿级后续市场;TA3公开平台若成为行业基准,其运营方将掌握“集群智能评估”这一新兴领域的话语权。这解释了为何在提案截止前,从传统主承包商到前沿实验室均在围绕DICE进行团队组合——竞争的实质不是一份研究合同,而是十万级智能体集群时代的架构定义权。
一、技术可行性评估:四道难关
DICE的构想建立在若干尚未被证明的技术假设之上,至少存在四道难关。第一是通信与推理复杂度的双重墙:即使按BAA的O(n log n)目标,十万智能体也意味着百万级消息与天文数字的推理token消耗,而每条消息都携带幻觉与误导传播的风险——集群可能“相互强化彼此的错误假设”,BAA对此仅提出“识别欺骗、隔离被策反节点”的考核目标,并未给出先验可行的解法。第二是黑盒控制的理论缺口:激活引导在单体模型上尚属前沿探索,角色向量在长周期、多角色、对抗扰动下的稳定性完全没有成熟理论支撑;对API黑盒模型的机制设计控制,本质上是要在无法观测内部状态的情况下保证行为不变量,其保证强度必然弱于白盒路线,而DICE恰恰要求异构模型混编。
第三是评估有效性问题:用《星际争霸》式粗粒度仿真评估“战争级”集群推理,其结论向真实作战环境的外推性存疑;队际季后赛虽然巧妙,但可能诱发“针对评测指标过拟合”的锦标赛策略,而非真实稳健的协同能力。第四是“智能体创造智能体”的失控梯度:第三阶段引入的递归自主性把验证复杂度推向新量级——当集群可以自行生成新成员时,角色一致性与任务对齐的验证对象本身在动态膨胀,现有的测试评估范式是否仍然成立,连BAA自身也未给出答案。综合判断:DICE在500—5000智能体尺度取得相对集中式基线的可测量优势是现实可期的,但十万规模的“受控涌现”更可能以“特定用例下的架构可行性证明”而非“通用能力”告终——这符合DARPA高风险高回报的定位,也应成为外界解读其成果时的理性预期。
二、风险与争议:在“可控”与“有用”之间
DICE最深刻的争议内生于其核心命题:受控涌现是一个内在紧张的目标。控制过强,集群退化为可预测但僵硬的自动化编队,丧失对敌博弈价值;控制过弱,角色漂移、恶意串通与工具性目标失准的风险随规模指数放大。BAA罕见地把“智能体发展出与任务不一致的工具性目标”作为设计约束公开写入,被业界解读为“DARPA首次把AI内部失准当作规划约束而非部署后安全问题”——这既是科学诚实,也等于官方承认失控风险是该项目的基本前提而非尾部事件。
伦理与治理层面的争议同样尖锐。其一,尽管DICE限定仿真边界,但其成果指向的应用——自主战场管理、兵力部署乃至交战支持——与“完全自主杀伤”之间只隔一层转化决策,Anthropic事件已经显示,前沿AI社群对这条界线的守卫意愿与五角大楼的“所有合法用途”立场之间存在结构性冲突。其二,十万级智能体集群一旦与武器平台结合,“有意义的人类控制”将在技术上进一步稀释,3000.09号指令的修订压力会随DICE每个阶段的推进而加剧。其三,评估平台的公开发布与CUI用例的并存,制造了开放科学与军事保密之间的持久张力,全球研究社区在参与共建评估标准的同时,也可能加速该技术向非国家行为体的扩散。
三、对全球军事AI格局及中国的影响
DICE对全球军事AI竞争格局的影响主要体现在三个方向。在范式层面,它把“蜂群竞争”从数量与平台工程竞赛,升级为“认知架构”竞赛——谁的集群能在对抗中以更少消息、更长推理链保持协同与对齐,谁就掌握下一代非对称优势;这会牵引各主要国家将多智能体系统的“受控涌现”研究从民用智能体赛道抽调至国防轨道。在标准层面,TA3公开评估平台结合A2A/MCP等协议,可能成为事实上的国际集群智能评测基准,先发定义评估标准的一方将获得类似“互联网协议制定权”的长期红利。在产业层面,DICE的适配器架构天然排斥封闭单体生态,奖励“模型可替换、角色可重组”的开放供应链,这与中国“通用平台+模块化载荷”的蜂群产业路线形成耐人寻味的同构竞争。
对中国而言,DICE的启示是多重的。中国已在“阿特拉斯”“九天”、彩虹系列等蜂群工程化部署上展示了从单机智能到集群智能的完整谱系,并在“去中心化协作”“任务边界式指挥”等概念上与DICE高度呼应。但DICE揭示的下一个竞争焦点——十万级认知智能体集群的角色一致性、对抗鲁棒性与可验证控制——目前在全球范围内都属无人区,谁能率先建立“受控涌现”的理论与评测体系,谁就能在智能化战争的规则制定中占先。同时,DICE也提供了风险镜鉴:认知型集群的失控、串通与欺骗问题不因制度差异而消失,对“可控性”的前置研究投入,应当与集群能力建设同步甚至超前。
四、前景研判:近期里程碑与三种情景
近期可跟踪的硬里程碑包括:2026年8月25日提案截止后的中标团队结构(尤其TA1/TA2联合体的构成与TA3评估方的归属);2027年2月项目启动后的第一阶段基线对比结果——这是检验“去中心化是否真优于集中编排”的第一个经验证据;2028年底的第二阶段季后赛淘汰结果,将首次展示对抗条件下集群控制技术的真实水平。中期看,DICE成果向DAWG、CCA后续批次与“无人机霸权”计划的转化路径,以及3000.09号指令的修订进程,将决定其从“仿真架构”走向“作战能力”的速度。
情景研判上,乐观情景(DICE在十万级仿真中证明受控涌现可行):美军获得认知集群架构的定义权,全球军事AI进入“集群对集群”的算法对抗时代,反制重心从电子战硬杀伤转向针对对手集群共识机制的“认知瓦解”。基准情景(部分成功):DICE在数千智能体尺度确立去中心化优势,十万级目标以受限用例形式达成,架构经DAWG管道渐进转化,但通用受控涌现仍是开放科学问题——这是概率最高的路径。悲观情景(黑盒控制与评估外推性两道难关同时卡壳):项目退化为多智能体系统的增量改进,集中式编排凭借工程成熟度继续保持主导,DICE的历史作用停留在“首次把AI失准问题制度化”的议程设置层面。无论哪种情景,DICE都已经完成了一项不可逆的工作:它把“十万规模自主思考作战集群”从科幻命题变成了有编号、有指标、有竞赛、有预算的国家科技议程。
DICE项目是理解2026年美国军事AI战略的一把钥匙:在546亿美元DAWG预算重塑硬件与采购格局的同时,DICE负责回答那个更根本的问题——当智能体的数量与自主性同时趋于无穷,人类还能以何种方式保持控制。其给出的答案是“受控涌现”:不是用指令锁死集群,而是用架构、不变量与局部推理控制,把创造力约束在意图之内。这一答案能否成立,将经由三阶段、五轮公开竞赛在2030年初接受检验。对于观察者而言,DICE的价值不仅在于跟踪一个DARPA项目的成败,更在于它所定义的议程——认知集群的协调、控制与评估——正在成为大国军事AI竞争的下一个主战场。
免责声明:本报告基于截至2026年7月19日的公开信息(含DARPA招标文件、政府公告及媒体报道)撰写,仅供一般参考与研究用途,不构成任何投资、法律或决策建议。项目尚处招标阶段,相关竞争格局分析属前瞻性研判,实际情况以DARPA官方发布为准。