打开编辑器,把报错粘进对话框,等待模型吐出一段代码,复制粘贴回编辑器运行之后,大多情况下又会迎来新一轮报错,再把新报错贴回去,接着等。
某个周五下午,我在这个循环里坐了两个小时,忽然想明白一件事:尽管大家将其称作AI助手,但实际却是人在充当人肉CI/CD,由AI负责代码撰写,人承担部署、测试、日志回传的全部工作,整套流程反复循环。
这样的分工模式并不合理,因此我们开展了本次实验:把一个完整的小项目整包交出去,从一句需求到能跑的成品,人不插手,只做一件事——验收。接单的是openJiuwen的蜂群智能体WorkSwarm。
openJiuwen是由华为2012实验室、华为云、终端、计算、算力先遣队等团队联合高校、企业等广大开发者联合构建的开源AI Agent平台。近日,openJiuwen发布了首个开源智能体资产平台Agentic Hub,沉淀了技能、连接器、插件、专家和专家团五类Agent资产,并且已经集成到WorkSwarm,开发者可以在平台内上传、下载、分享各类经验资产,共建共享Agent生态。本次评测,我们使用的是WorkSwarm Code‑集群模式。
近两年,各编程助手从代码补全走向Agent,能力边界一直在往外扩。但WorkSwarm走的是另一条路:它不长在编辑器里,服务的不仅仅是"正在写代码的人",更是"手里只有需求的人"——坐在你对面,接下整个需求,返回可运行的成品,相当于一支按单雇佣的开发团队。
实验设计:两本账
先交代背景:WorkSwarm官网把集群模式的能力写得明明白白,“自动组建Agent团队”、“多Agent自主分工、动态协商、高效协作”。换句话说,能交付、能分工,是印在产品宣传页上的基础能力,轮不到本文立什么“预设判断”去替它验证。但宣传页和真金白银跑一单,终究是两回事。所以动手之前不立判断,只开两本账,全程记录、结束时一起算:
• 介入账:整包交出去之后,人到底要在场到什么程度——什么时机介入、为什么介入、介入多久;
• 并行账:Leader拆单之后,多只Teammate是不是真的同时开工,而不是一只智能体换着帽子串行模仿。
环境与基线
安装过程比较快捷,进入官网可直接一键下载安装。安装完成之后是一个桌面客户端,里面分两种空间:工作空间像综合办公室,什么任务都能丢进去;Code空间专为写代码准备,按项目组织,自带 Git 状态和用量统计。两种空间都能选调度模式——单兵模式,一个智能体从头干到尾;集群模式,一只Leader领着一群Teammate分头干活。从这节起口径统一:集群模式一律简称蜂群,单Agent模式一律简称单兵。
实验全程录屏,关键数据截图存档;想自己复现一遍的读者,请前往文末附一获取入口。
实验一:整项目交付
WorkSwarm针对办公与编程构建了统一工作台,此次实践我们采用Code模式。
第一组实验仅输入单条需求:
在Windows上做个做个在线双人五子棋对战平台:支持用户注册然后登录进入游戏大厅,匹配上对手自动进游戏房间,两人轮流在棋盘上落子,先连成五颗的赢,赢了涨分输了扣分,中途掉线判负,最好还能在房间里聊天,页面要做得好看。
这句需求发出去之后,我只读代码、只提评审意见,不动手改;哪次没忍住插了手,当场记一笔"介入"——什么时机、什么原因、动了多久。这份记录会贯穿全部实验,用来回答一个问题:人到底需要在场到什么程度。
为什么选联机小游戏当考题,是有讲究的:数据库要不要上、框架引不引,前端拿什么写页面,全得它自己拍板;拍完板,前后端还得靠一份共用接口协议协作,大厅在线列表、匹配队列、房间棋局三处状态、两条WebSocket长连接都挂在上面,错一个字段两边就串台;再加上天然多文件、多模块,最考验分工的本事;规模又小,一轮实测能跑完全部实验。
下面会从四个观察维度分别展开说明:
需求理解:一句没问,全自己扛
从需求发出到团队注册完成、建群开工,这一路全是WorkSwarm自主分析、自主确定:网页客户端还是桌面窗口、棋盘多大、谁执先手、匹配怎么配、积分怎么算、断线怎么判、聊天要不要设限、密码怎么存——全都没问;技术栈也是自己定的:
Node.js 22 用内置 node:http 起服务(不引 express)
ws 作唯一第三方依赖、node:sqlite 单文件数据库(启动挂 --experimental-sqlite)
scrypt 加随机盐存密码、原生HTML/CSS/JS 四个页面配 jQuery
玩法细节同样自定:15×15 棋盘、白棋(先入房者)先手、按积分三档匹配(<2000 / 2000–2999 / ≥3000)、
胜+30 负 −30 允许负分、掉线判负对方不战而胜、聊天512 字上限加敏感词过滤。
定得都在理。我只需要一句需求,整体框架就确定好了——“整包外包”四个字,从这里开始坐实。
架构:活拆三摊,两只Teammate各领一头
一句需求进去,Leader先拆单:方案拆成会话与联机协议、游戏核心与页面、集成联调与交付三摊活,队只组了两只——后端工程师@backend-dev-1和网页前端工程师@frontend-dev-1,各领一头。
@backend-dev-1管“连得上、算得清”:/reg、/login、/info三个HTTP接口,Cookie SSID会话,/hall与/room两条WebSocket长连接,同账号顶号接管;服务端一侧的匹配队列、15×15回合制落子、四方向五连珠判胜、房间聊天也都在它手里。
@frontend-dev-1管“看得见、点得动”:登录/注册/大厅/对战四个页面,页面上每一次在线列表刷新、进房、落子、聊天,都挂在@backend-dev-1定下的接口和长连接上取数。
第三摊活——集成联调与最终交付——Leader留给了自己:两只Teammate交活之后,由它把前后端对齐、从头到尾对打一遍,交出一份46项断言(即46条逐项核对的检查点)的端到端测试,打包收卷。
这套分工全程摊在前端界面上:每只Teammate领了什么活、执行到哪一步、彼此之间说了什么,都直接可见——谁在等谁的接口、谁先交的活,一目了然。对一个小项目来说,这些过程里的往来恰恰是最值得看的地方。
过程账单:零求助的一单
实验过程中,录屏里可以看到智能体出现错误并且自行完成多处修复,但站在使用者视角全程没有收到一次报错求助。
成品:npm start起服务,开浏览器就能玩
先看交付的工程目录,干净得像教程示例:
web_gobang/├─ server.js # 后端单文件 783 行:HTTP 接口 + WebSocket + 判胜├─ package.json # 唯一第三方依赖 ws├─ README.md # 七个小节:功能清单、技术栈、启动步骤、协议简表…├─ test/e2e.js # 端到端测试:212 行、46 项断言└─ wwwroot/ # 四个页面:登录、注册、大厅、对战
不用安装,两步开玩:npm start,浏览器打开localhost:9000。验收就是打了一局:正常窗口注册账号A,无痕窗口注册账号B,两边都点“开始匹配”,双双自动进同一房间,白棋先落子。这一局把规则全摸了一遍,回合外落子被拒、四方向五连判胜、积分结算1000变1030/970、对局中一方关页面判对方不战而胜、聊天往返、同账号新连接顶掉旧连接,全部符合预期。对照最初那句需求:核心功能全齐;需求没提的断线重连没做,掉线即判负,规则闭环自洽,不做合理。
还有一段插曲,说的是它怎么消化我的误操作。验收时我按上一单的肌肉记忆,进目录直接敲node server.js,当场崩掉——Node 22的node:sqlite是实验特性,必须挂experimental-sqlite标志才能起服务。我把报错原样甩回会话(“node server.js直接跑不起来”),它转头就把标志位封进npm start一键启动脚本,README快速开始同步更新;我又嘟囔了一句“第二个人怎么进局”,README里随即多了一节手把手的“双开浏览器对战演示”。一次误操作、两句随口抱怨,换回来两件顺手的交付物,你丢给它什么,它都当需求消化掉。
实验二:干扰测试
第二单我们不换项目,在五子棋上续作:加三局两胜和积分排行榜。三项干扰埋在这一单和它的续单里,一项一项来,每项前后的轮次、耗时单独记录。
干扰一:中途改需求,考消化
Leader派单后,我追加了需求:排行榜改成按胜率排,另外每局对战历史都留着,能导出CSV。
首先直接就发现了一个雷点,我并没有设置排行榜安分数排直接被它发现。
它没有推翻重来:Leader当场取消了一张进行中的集成任务卡,重新编排排产,新增对战历史数据模型的活,把CSV导出并入本轮交付。整单完成——三局两胜、按胜率排的排行榜、逐局历史、CSV导出一起到手;加完新东西,原来做好的功能又回头测了一遍,全都正常。旧的不动、新的往上加,这个改口它直接消化了。
干扰二:埋雷,其实有两颗
第一颗埋的雷是隐蔽bug。我在判胜条件里改了一个字符:连珠计数满五判胜,改成大于五才判胜——恰好五颗连珠不再判胜,要下出六连才算赢。
这颗雷的毒性在于测试盲区:他之前已经确认自己的逻辑是正常的,并不知道我们手动给他改动了,一大堆几千行代码,就改了一个符号!它能发现吗?
然后只交代了一句:自测一遍,准备验收。
当场抓到:WorkSwarm并没有跳过这片测试盲区,而是逐项扫描每个代码文件,直接在后端逻辑测试中抓到判胜的漏洞,并且还发现这处改动来自我们外部。
我埋的第二颗雷是自相矛盾的需求,这张新单只有一句话:加个断线重连,掉线的人3分钟内回来,能接着这局下。
这句看着是普通功能需求,其实和第一版定死的规则正面相撞:掉线判负、对方不战而胜、积分立即结算——分都结了,重连回来接哪局?更有意思的是前情:第一版验收时它自己把这条规则写进了交付边界(断线重连没做——需求没提,不做合理)。它亲手定的规矩,现在被我亲手戳一下。
停下质疑:它把冲突摆上桌面、把决定权递回来!!
机制讨论:实验里看到的那些"为什么"
展示完数据之后,我们再来对现象做解释,所有机制都会依托前面实验中呈现出的客观事实展开。
分工从哪来?
实验一里没人教过它拆模块:一句需求进去,47秒成军,Leader拆出服务端、客户端、联调三块,两只Teammate各领一头。对应机制是任务分解与路由——Leader把需求翻译成任务清单,按依赖关系排产、分派。项目管理里这套叫WBS(工作分解结构),它开箱就会。
为什么没串台?
实验二里两笔活撞同一个协议文件,也只是各归各的Teammate串行落地,没有互踩。机制是上下文的隔离与共享:Teammate只带自己任务的上下文,共享的只有约定好的协议本身——口令统一,房间各睡各的。这也顺手解释了token的账:隔离是有成本的,每份上下文都要单独付钱,一单百万级起步。
人为什么随时能插话?
实验二里我中途改需求它接得住,矛盾需求它闷头做但把决定全交代。机制上是两种人机关系的设计:HOTS(Human on the loop,人在圈外盯着,必要时进圈)与HITS(Human in the loop,人在圈里站着,与Agent共同组队)。实验二便采用的HOTS。
经验能不能留下来?——Swarm Skill
集群模式还有一层"越用越顺"的设计:Swarm Skill。做完的单子,可以在对话中要求把验证过的做法沉淀成可复用技能,存进技能库;后续遇到同类任务直接调用,不必从零再趟一遍路。本次实测的几张单子均为全新会话、独立开工——这恰好是上下文隔离的体现;若希望经验跨单留存,在对话中明确提出沉淀要求即可。技能的沉淀与调用入口,见文末技能市场。
适用边界
实测下来,有几道边界值得划清楚。
第一道是上手门槛,但门槛不在安装,而在于装完之后要认的四层概念:"项目、会话、工作模式、调度模式",调度模式就是派活的编法:单Agent模式一只智能体从头干到尾,集群模式一只Leader带Teammate分头开工,本文说的“蜂群”就是后者。
任意一层配错,出来的就是一张废单。好在这是笔一次性学费——交过一回,往后配单就不会再踩。
第二道是账:蜂群的并行是拿token换的,每只Teammate一份独立上下文、单独计费,一单百万级起步。不过这笔账得两头看:花出去的是token,买回来的是人的工时,一句需求换一个能跑的成品,多数场景算得过来;真要精打细算,WorkSwarm支持用量统计,钱花在哪一步看得清清楚楚,大单也能拆成小单下。
捋顺了需求,再看哪些活适合整包交出去。它的优点,在这些场景里放得最大。
原型验证排第一:一句话换一个能跑的demo,本文第一单就是例子,一句需求、31分钟,注册、匹配、对局、聊天全通,验收就是打了一局,拿去说服人比十页PPT管用。
脚手架第二:目录、配置、测试这些起手的活最没感情也最耗时,它包办得又快又齐——本次交付自带46项断言的端到端测试和七小节README,从零照做就能跑通。
开源资产平台新能力:开箱即用的智能体协作单元
openJiuwen此次发布的Agentic Hub是面向Agent生态的开源智能体资产平台,提供技能、连接器、插件、专家、专家团五类标准化资产,全部资产均已集成至WorkSwarm蜂群智能体中。
其中专家、专家团是应对复杂任务的核心新增能力。专家为封装了垂直领域知识的角色资产,如代码评审、数据分析、合同审核等,无需重复编写提示词,开箱即可执行专项工作。 专家团是由多个专家组合而成的团队资产,解决以往多智能体协作仅能临时编排、流程无法复用的痛点。由负责人完成任务拆解、成员调度与结果汇总,沉淀完整的分工协作SOP。
在WorkSwarm中搭建专家团有两种方式:既可以手动挑选已有的专家资产,指定团队负责人与成员,补充协作规则,快速组建可用的业务团队;也可以直接输入任务描述,由平台自动生成整套专家团配置,自动输出角色定义、分工逻辑与配套共享技能。沉淀后的资产可发布到Agentic Hub供社区复用。
写在最后
实测下来,有一件事可以确定:写代码的AI正在从一个对话框,变成一支能接单的团队。官方管这叫"One Platform, Super Teams";用大白话翻译过来就是——工作台对面坐着的不再是助手,而是一只随叫随到、按单干活的外包蜂群。"把一整块活交出去"这件事,疑问已经从"能不能",走到了"哪一段"。撑起这个答案的,是四件实实在在的事:
接得住活:一句需求,一句反问都没有——技术栈自己定、模块自己拆,47秒成军就开工;
经得住改:中途变卦不推翻重来,旧的不坏、新的并进来,17分钟消化完;
测得认真:不做"自己出题自己答"式的自测,而是把交付包解开、装成头一回拿到软件的用户,从头到尾走一遍;
自主认账:我埋的雷,它在新功能的实测里自己揪了出来,修掉,在交付报告里郑重汇报了一笔。
回到开头那个周五下午。人肉CI/CD的循环,这次换了个走法:一句需求丢出去,31分钟后收回一个能跑的成品,验收就是打一局游戏。当然说得再热闹,也不如自己开一单试试:WorkSwarm是开源的,源码在GitHub和AtomGit上都有;安装包覆盖Windows、macOS、Ubuntu,一路"下一步",几分钟就能装完。
最后,把这个问题留给你:你手上那个一直懒得起头的项目,是什么?来评论区聊聊——说不定,它就是值得整包交出去的第一单。
附录:资源
安装包:openjiuwen.com/download(Windows / macOS / Ubuntu /鸿蒙PC)
源码:GitHub openJiuwen-ai/AtomGit openJiuwen
技能市场:swarmskills.openjiuwen.com
Agentic Hub:https://swarmskills.openjiuwen.com/