NeoHorse-1 4B 在 Agent 任务上的表现已超过多个参数量显著更大的通用模型;9B 版本在更复杂的推理与长程规划任务上表现更优。两个规模的后训练增益,都最突出地体现在 Agentic 任务上。
模型链接 https://www.modelscope.cn/models/TokenRhythm/NeoHorse-1-4B https://www.modelscope.cn/models/TokenRhythm/NeoHorse-1-9B 代码仓库 https://github.com/TokenRhythm/NeoHorse 技术报告 https://arxiv.org/abs/2609.08183
一次完整的任务执行,会在 Harness 中留下结构化记录:任务请求、能力需求评估、路由选择、模型响应、工具调用、环境反馈、错误与恢复路径、最终完成状态。相比传统问答语料「题目与答案」的形态,执行轨迹多出三个维度的信息:能力需求、执行决策、环境结果。
其中既有成功经验,也有被中途替换的失败轨迹——最终答案只能说明「怎么做对」,失败与修复过程则说明「哪里容易出错、出错后如何恢复」。
Agent 轨迹通常很长,包含系统提示、工具参数、重复尝试、错误信息与中间输出,不能直接用于训练。据技术报告,每条轨迹先经过结构检查,确认请求、模型回复、工具调用与环境结果之间正确对应;再从六个维度进行质量评估:是否完成任务目标、是否遵循指令、工具使用是否合理、结论是否有证据支撑、遇到错误后是否恢复、是否在正确时机终止。
因此,NeoHorse-1 的训练目标从一开始就指向任务完成,而不是在通用模型训练后再补充 Agent 场景适配。团队将这一取向称为 Agent-Native。
Harness 路由器在每一轮对话上估计「这个任务需要多强的能力」,并归入四个服务档位:C0 处理边界清晰的低风险请求,C1 是通用默认档,C2 支持多步推理与执行,C3 提供最高能力或最高可靠性。
这个档位判断原本只用于线上选模型,NeoHorse-1 把它变成了训练信号。
训练完成后,将路由记录拆成「预测—行动—结果」三段:路由器预测的能力需求、策略实际选择的档位、以及任务最终结果。这种分离让训练侧只用「预测」来排课程,而「结果」字段则提供能力短板信号——哪些子场景反复失败、哪些环节恢复成本高、哪些能力档位供给不足。
这些短板信号被用来调整下一轮的训练数据配比,形成「评测反馈 → 数据配比 → 更新模型」的闭环。报告称之为 Capability-Guided Data Allocation(能力引导的数据配比)。
Data-RSI:模型在 Harness 中持续执行任务,每一次路由、工具调用、失败恢复与最终结果都产生新的结构化记录,经筛选处理后成为后续训练的候选材料,随系统运行自然增加; Model-RSI:系统根据评测结果定位当前模型的能力短板,调整下一轮训练数据分布,更新模型,再把新模型放回 Harness 模型池继续工作。
当前 NeoHorse-1 尚不能被视为完整的 RSI 系统。
技术报告验证的是一次“执行—评估—选择—更新”闭环。信号编译、奖励设计和训练流程仍然由人类设定,多代模型能否持续获得稳定增益,也有待后续实验。
这次发布提供了两层验证:结构化执行经验可以转化为模型训练材料;同一 Harness 中可以完成一次“执行—评估—选择—更新”的 RSI 工程闭环。
基元律动将其业务闭环描述为:OpenSquilla 承接 Agent 任务,Routing 识别各环节适配的模型,TokenRhythm API 输出能力,任务反馈再用于迭代路由与模型,更新后的模型重新进入模型池。
NeoHorse-1 将自研 Agent 模型纳入这套多模型协作网络,为“执行轨迹—训练更新—重新执行”的循环提供了首轮实验结果。
作为联合首发方,无问芯穹提供底层基础设施与推理优化支持,用于承载大规模 Agent 推理任务;其弹性训练系统还用于提升训练效率和稳定性。 由汪玉老师发起,清华大学、北京大学、香港中文大学团队参与算法与训练方法研究;阿里巴巴等机构为模型推理等环节提供支持。
安装下载工具
下载模型
SGLang 部署
vLLM 部署
OpenAI 兼容 API 调用
👇点击关注ModelScope公众号获取 更多技术信息~