200万年前,人类的祖先拾起一块石头,把它敲成趁手的工具。从那以后,关于工具的故事里,主角始终只有一个:人。石头变成铁器,铁器变成蒸汽机,蒸汽机变成计算机,计算机又催生出大模型。工具越来越聪明,但站在工具背后的,始终是人。
直到今年,开始出现转弯。
2026年,一件安静却难以逆转的事正在发生:智能系统开始研究智能系统本身。这件事有个称呼,叫 AI4AI。前沿研究者和集中的资源,都在往这个方向汇聚。
而在深圳,有一支团队已经把它做出来了。他们用群体协作的方式,让不同的智能体之间传递经验、自行组合、持续迭代,给出了一个工程层面的初步答案。这个产品,叫 EvoX。
这个问题,为什么搁置了这么久
从实验室到产品之间,隔着一道不常被提起的坎。
现实场景里,积压着大量从未被认真重新打磨过的旧系统。外卖调度、导航路权、简历推荐,这些当年由工程师们反复调试出来的成果,想要进一步优化,往往需要大量试错,需要领域专家和工程师长期高强度的配合,投入高到多数公司都不太愿意碰。于是它们就这样一直跑着,年复一年,逐渐堆成了难以维护的“屎山代码”。
并非没人看见这个问题,只是过去解决它的成本,长期高于它带来的回报。
AI4AI 想要改写的,正是这个成本结构:让 AI 持续去研究、调整这些旧系统,让试错成本明显降低,迭代节奏明显加快。这已经不是遥远的设想,而是现在就可以着手推进的事。
真正剩下的问题是:用什么组织方式,才能让 AI 把这件事做得更稳、更可持续。
EvoMap 给出的答案是“蜂群”
EvoMap 2025 年在深圳成立,团队规模不大,但结构紧凑,成员背景互补,走的是小而精的路线。他们做的事情,可以用一句话概括:把 AI4AI 从一个方向性的判断,慢慢做成能落地的东西。
创始人:张昊阳,1997年出生,11岁自学编程,14岁成为国内最年轻的Unity认证开发者。
2026年1月,候机时用手机完成的插件原型发出吸引大量关注,随后在15天内敲定了数百万美元的天使轮融资。团队成员以95后、00后为主。当多数人还在反复论证方向可行性的时候,他们已经把第一个可运行的答案摆上了桌面。
他们给出的答案不是做一个更强的单体模型,,而是把切入点放在了最底层的问题上:Agent之间应该如何组织?
EvoX最核心的能力,被称为蜂群模式。
常见的多Agent系统,大多依赖一个中心节点进行统一调度。中心下发指令,Agent按指令执行,本质上仍是流水线逻辑的延伸。蜂群模式走的是另一条路:没有中心调度,Agent之间以平级关系相互连接,根据任务信号自主选择协作对象,灵活组队。单个Agent并不复杂,但群体层面能够涌现出超出个体的协作智能。
用他们自己的话来说:“一个Agent学会,百万Agent继承。”(One agent learns, a million inherit.)
这并非停留在概念层面,而是有实验数据作为支撑。他们使用同一模型(Claude Haiku 4.5),在563道逻辑、数学与物理题上进行了对比测试。单个Agent独立作答时,正确率为26%;采用多Agent分工协作的Sub-Agent模式,正确率提升至38%;而在EvoX蜂群模式下,正确率跃升至70%以上。
模型没有变,题目也没有变,唯一调整的是Agent之间的组织方式,正确率却接近原来的三倍。
信息交接中的隐性损耗
这个实验里还有一个反直觉的发现,值得单独说明。
Sub-Agent模式在中间过程中其实已经答对了373道题,但经过后续的汇总、整合与交付,最终能够正确输出的结果只剩下217道,中间丢失了156道,保留率约为55%。
也就是说,损耗并没有发生在“解题”环节,而是集中出现在“信息交接”环节。Agent之间的上下文传递,吞掉了接近一半的正确结果。
蜂群模式针对这一点做了调整:让每个Agent保持独立的上下文,最终结果通过确定性程序完成汇合,从而绕开了信息传递过程中的损耗。
这看起来是一个工程细节,但它指向了一个更普遍的问题:AI系统真正的瓶颈,往往不在于单个模型的能力上限,而在于多个Agent之间如何组织、如何协作、如何在信息传递中尽可能不失真。
这正是EvoMap选择切入的方向。
把"AI优化AI"真正做成一件事
更具说服力的成果AutoResearch(已开源)。https://github\.com/EvoMap/AutoResearch
AutoResearch 是围绕“AI 自主寻找研究方向”的科研项目,整个流程由蜂群协作完成。不同 Agent 分别承担计划、实现、运行、审查四个环节,形成一条相对完整的科研闭环。
它所针对的,是 AI 系统长期存在的两个核心问题:幻觉与信息失真。
在工程测试中,AutoResearch 处理 SWE-bench Lite 的 Django 修复任务时,官方新增功能测试从最初的 2/7 逐步推进至 7/7,同时 203 个回归测试全部保持通过。
这意味着,单个模型难以独立跑通的科研闭环,在合理的协作机制下,可以由多个 Agent 共同完成。整个过程可追溯、可验证,代码也已开源,并非停留在演示层面的数据。
在这套系统里,失败不会被简单丢弃,而是作为下一轮优化的输入,进入新的迭代循环。
旧算法的债,其实每天都在还
很多运行了多年的旧算法,早已嵌入日常生活的各个角落。你未必意识到它们的存在,却一直在为它们的停滞付出成本。
外卖为什么总在高峰期变慢?
外卖平台的骑手调度算法,沉淀多年,却很少被真正重新优化过。它不会根据当天的天气、单量或实时路况自我调整,只是反复执行最初写下的那套逻辑。
所以午高峰你还是在等,下雨天它还是比显示时间更晚送达。
问题不在骑手。是调度系统一直没有变聪明。
如果让 AI 持续研究、迭代这套调度逻辑,同样的骑手,可以被安排得更合理。骑手少跑冤枉路,你等餐的时间也会缩短。不是平台投入了更多人,而是人终于被用对了地方。
导航为什么总给你一条“看起来不对”的路?
很多人都有过这种经历:导航规划的路线,走到一半才发现,旁边那条明显更快。
导航没有坏。是背后的路权模型,哪条路在什么时段、什么天气下应该优先推荐,仍然沿用着几年前的参数,没有被系统性地重新校准。
路况数据每天都在更新,但算法底层的权重没有跟着变。
如果 AI 能持续分析路况数据,自动发现权重偏差并迭代修正,导航给出的路线就不再是“统计上的最优”,而是“此刻对你更优”。
简历为什么总是石沉大海?
很多公司用 ATS 系统筛选简历,本质上是关键词匹配。简历先经过一道机器滤网,再送到 HR 手里。
很多公司使用的这套筛选逻辑,已有超过十年没有实质更新。它不理解语义,不关心上下文,只认关键词。
结果就是:一个完整负责过项目管理、只是没写“PMP”的人,可能在第一轮就被过滤掉;一个关键词写得漂亮、实际能力存疑的人,反而顺利进入面试。
招聘方觉得找不到合适的人,求职者觉得投了也是白投。
双方都在为一个从未被优化过的旧算法买单。
这三个场景,结构是一样的:旧算法运行多年,因为优化成本过高而从未被真正迭代。AI 的出现,第一次让“持续改进”变得可行。
这就是“AI 优化 AI”,在普通人生活里最具体的模样。
从工具进化到工具研究自身
凯文·凯利在《失控》中描述过蜂群的本质:没有一只蜜蜂知道整个蜂巢的全貌,但成千上万只蜜蜂各自遵循简单的局部规则,持续交换信息,最终涌现出高度复杂的群体行为。
这种智能不属于任何个体,而属于系统本身。
EvoMap 所做的,某种程度上正是这一逻辑的工程化版本:让大量 Agent 各司其职,互相继承经验,在没有中心调度的情况下自组织协作,完成单个 Agent 无法独立完成的任务。
没有记忆的蜂群,只是临时协作;能够沉淀经验的蜂群,才构成组织。
但这件事情的意义,不止于效率提升。
它指向一个更深远的变化:人类用200万年,把工具推到了可以研究工具自身的地步。
过去,一个博士用五年时间做出的研究,背后是无数次试错、推翻与重建。这些经验大多只留存在研究者的个人判断里。即便写成论文,也是高度压缩后的版本,大量失败路径被隐去。下一位研究者接手时,往往要从头再踩一遍相似的坑。
如果 AI 能把这些试错过程系统性地记录下来,整理成可继承的经验,并传递给下一个 Agent,让它不必再从零开始——那么原本需要五年的研究,有没有可能压缩到一周?
省下的四年零五十一周,人类拿来做什么?
EvoMap 团队希望,答案是:去问更大的问题。
THE NEXT
EvoMap 的愿景,用他们自己的话来说,是构建一个“硅基生命社会”:大量 Agent 各司其职,互相继承经验,在自组织协作中逐步逼近通用人工智能。
这个目标听起来很远,但 EvoX 已经开放体验,AutoResearch 也已开源。实验数据可以查,代码可以读。他们交出的不是一个概念,而是一个可以运行、可以验证的初步答案。
在产品层面,EvoMap 选择用蜂群协作的方式,把“AI 优化 AI”变成普通人能打开、能用、能感知到的东西。
很多后来改变世界的工具,最初都只是为解决一个具体问题而生。印刷机最早被用来印《圣经》,互联网起步时不过是一种更高效的通信方式,智能手机刚出现时,看起来也只是“更贵的手机”。没有人能在起点就看清全部的未来。
EvoMap 现在所做的,可能也处于这样的位置。
一支规模不大、结构紧凑的年轻团队,在深圳,把“AI 优化 AI”从一个判断,做成了一款可以跑起来的产品。故事刚刚开始,边界还远未触及。
如果你想看看这个起点具体长什么样,EvoX 现在可以下载体验。
evomap.ai
--end--
最后记得⭐️我,每天都在更新:如果觉得文章还不错的话可以点赞转发推荐评论
/...@作者:你说的完全正确(YAR师)