作为新一代星辰大模型,Xing4.0 在 TeleChat1-3 系列基础上全面升级,从模型架构、训练 Infra 到能力范式实现全面跃迁。如果说此前 TeleChat1-3 系列大模型更多解决的是“你问我,我回答”,那么 Xing4.0 系列大模型要解决的,是“你给我一个目标,我帮你把事情做完”。Xing4.0 正在推动星辰系列大模型从“会回答”走向“会做事”。这不仅是一次模型版本的迭代,更是星辰大模型一次能力范式的跃迁。
面向 Agent 场景对模型理解、规划与执行能力提出的新需求,Xing4.0-29B-A4B 采用 mHC+MLA+MTP 架构设计,可高效处理长程 Agent 任务,支持多步骤规划、工具调用和复杂推理链路执行,保障长会话上下文下任务逻辑连贯、执行稳定。
通过 4-bit 量化技术,模型将单卡显存占用降低至约 15GB,相比 FP16 方案降低约 75%,在 RTX 3090、RTX 4090 等 24GB 显存消费级 GPU 上即可支持本地运行长上下文任务。
在性能表现上,模型在 SWE-bench Verified 取得 75.0,在 SuperCLUE 智能体能力评测中得分 93.52、位列第 3 名。
Github:
编码 Agent
其中,SWE-bench Verified(75.0)接近 Qwen3.6-35B-A3B(76.0),大幅超过 Gemma4-26B-A4B(53.0);Terminal-Bench 2.1(57.5)同时超过 Qwen3.6-35B-A3B(51.5)和 Gemma4-26B-A4B(30.0)。
通用 Agent
其中,Claw-Eval(76.55)超过 Qwen3.6-35B-A3B(74.54)和 Gemma4-26B-A4B(71.49),DeepresearchBII(60.80)也超过 Qwen3.6-35B-A3B(59.70)和 Gemma4-26B-A4B(39.30)。
架构设计
训练采用分阶段递进策略,序列长度从 4K 逐步扩展至 32K、128K、256K,系统性构建长程上下文能力。
训练 Infra
多专家强化学习
通过模型架构、训练 Infra 与强化学习三个层面的协同攻坚,Xing4.0-29B-A4B 打通从模型架构适配、国产算力训练到强化学习能力增强的完整技术链路,实现模型与国产芯片、国产框架的深度融合,形成“国芯训国模”的新路径。
这意味着个人开发者、小型工作室、中小企业不用采购昂贵的 A 系列专业卡,依托现有消费级硬件就能本地跑起模型。既能完成复杂任务拆解、工具调用执行,也能保证数据安全私密。
主流开源生态兼容
Agent 框架无缝接入
FlagOS 跨芯统一适配
此外,FlagOS 技术栈为 Xing4.0-29B 提供了统一支持多种 AI 芯片的推理插件,包括 vLLM-plugin-FL 和 SGLang-plugin-FL 两种推理框架插件。依托 FlagOS 的异构抽象层与统一运行时,模型可实现跨芯片架构的无缝迁移与一键部署,真正打破算力边界,让异构多元算力开箱即用。
1. 数据不出域,表格能读懂
2. 复杂任务,自主拆解执行
面对复杂的企业选型对比需求,模型可以将复杂需求拆解为 12 步闭环可执行链路,每一步精准匹配对应工具。
3. 一句需求,自动生成应用
4. 发现问题,自动编程排障
5. 客服智能体:端到端秒级响应,复杂业务自主办理
隐私安全可控:模型总参数量 29B、激活参数仅 4B,硬件资源占用低,可在本地环境独立运行,确保用户通话数据、身份信息及业务记录全程不出域,满足核心生产系统的合规要求。 复杂任务自主闭环:模型具备多步自主规划与深度推理能力,可协同调度外部工具链及多个下游子智能体,构建“意图理解→任务拆解→工具调用→结果整合→合规校验”的完整闭环。面对模糊意图与多轮交叉诉求,动态调度业务办理、风控校验等子智能体协同作业,实现从简单问答到复杂业务自助办理的跨越。 端到端秒级响应:基于稀疏激活架构,模型在保障业务效果的同时实现极致推理效率,端到端首 Token 响应时延压降明显,充分满足热线实时通话对低时延、高并发的严苛要求,保障用户“边说边响应”的流畅体验。
目前相关 PR 尚待合入上游主分支,本节重点介绍官方已提供启动示例的 vLLM、SGLang 和 KTransformers。复杂推理与通用任务推荐设置 temperature=1.0、top_p=0.95、repetition_penalty=1.05;代码与智能体任务可将 temperature 调整为 0.8。
模型下载
通过 Transformers推理
vLLM 部署
vLLM 适配PR:https://github.com/vllm-project/vllm/pull/57135
SGLang 部署
SGLang 适配 PR:https://github.com/sgl-project/sglang/pull/39793
KTransformers 部署
OpenAI 兼容 API 调用
其他框架适配进展
TensorRT-LLM:https://github.com/NVIDIA/TensorRT-LLM/pull/19283 llama.cpp:https://github.com/ggml-org/llama.cpp/pull/29012
👇点击关注ModelScope公众号获取 更多技术信息~