9 月 10 日,今天值得关注的项目覆盖多模态模型、机器翻译、Agent 评测与 GPU 开发:DeepSeek V4.1 Flash 正式发布并开放权重,蚂蚁百灵开放视觉模型,Cohere 推出专用翻译模型。开发工具方面,Sierra 将评测对象扩展到“构建 Agent 的 Agent”,NVIDIA 则介绍了 Rust 编写 GPU 内核的两条路线。
★ DeepSeek V4.1 Flash
原生理解图像与文本,通过新架构压缩长上下文缓存,支持推理、编程与工具调用任务。
DeepSeek 于 9 月 10 日正式发布 V4.1 Flash,API 同步上线,模型权重采用 MIT 许可证开放。新模型原生处理图像和文本,支持最高百万 Token 上下文,可用于看图分析、代码开发和需要连续调用工具的任务。
这次更新采用新的因果编码器—解码器架构,并通过跨层共享与压缩减少 KV 缓存占用。模型卡列出的主干参数量为 552B,输入预填充和解码阶段分别激活 8B、16B 参数。设计重点是提高输入较长、需要反复读取上下文的 Agent 工作流效率;自行部署仍需按完整权重及附加组件配置资源。
开发者将 API 模型名设为 deepseek-flash,即可调用正式版。官方同时宣布,9 月 14 日北京时间 12:00 后,原 deepseek-v4-pro 请求将路由至 V4.1 Flash,并按 Flash 单价计费,直至后续 V4.1 Pro 上线。
上手门槛
开发接入:🟢 低|使用官方 API|正式版模型名为 deepseek-flash
自行部署:🔴 极高|已开放 FP8 权重|552B 主干及附加组件,需要大容量内存与多卡部署
API 文档:https://api-docs.deepseek.com/zh-cn/
模型权重:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
更新说明:https://api-docs.deepseek.com/zh-cn/updates/
★ 蚂蚁百灵 Ling-3.0-flash-VL
理解图像、视频、文档与界面,并依据视觉反馈推进推理、工具调用和任务验证。
蚂蚁百灵近日宣布开源 Ling-3.0-flash-VL,开放 BF16 与 FP8 权重,采用 MIT 许可证。模型在 Ling-3.0-flash 基础上加入原生视觉能力,将图像和视频信息用于理解、推理、行动与结果检查。
它既能处理图表、复杂版式和文档内容,也能理解网页及软件界面,为后续操作提供依据。对于需要观察执行结果的 Agent,视觉输入可以帮助模型判断当前状态、发现偏差,再决定下一步动作,适合探索文档分析、界面自动化与视觉辅助开发。
项目提供模型权重和推理说明,官方平台也已提供多模态 API。自行部署的长上下文参考方案采用多张数据中心 GPU;开发者可以先通过 API 验证业务效果,再评估私有部署成本。
上手门槛
开发接入:🟢 低|提供 OpenAI、Anthropic 兼容 API
自行部署:🔴 极高|权重已开放|官方长上下文参考方案采用多张数据中心 GPU
API 文档:https://developer.ant-ling.com/en/docs/tutorials/multimodal-understanding/
BF16 权重:https://huggingface.co/inclusionAI/Ling-3.0-flash-VL
FP8 权重:https://huggingface.co/inclusionAI/Ling-3.0-flash-VL-fp8
★ Cohere North Small Translate
面向文档、产品内容与客户沟通提供专用机器翻译,覆盖 50 多种语言及地区变体。
Cohere 于 9 月 9 日发布 North Small Translate,将机器翻译作为专门优化的任务。它支持简体中文、繁体中文、英语、日语等 50 多种语言及地区变体,可接入内部知识库、技术手册、产品本地化和多语言客服流程。
模型采用 MoE 架构,总参数为 218B,激活参数为 25B,上下文窗口为 16K。Cohere 提供 Chat V2 API,免费使用受速率限制;对于关注数据存放位置的团队,也提供开放权重与商业私有部署路径。
需要注意,FP8 权重采用 CC BY-NC 4.0,仅限非商业用途。企业生产部署需另行购买商业许可,并可通过 Model Vault 部署。官方建议硬件为两张 H100 或一张 B200,名称中的 Small 并不意味着普通电脑即可运行。
上手门槛
开发接入:🟢 较低|提供 Chat V2 API|免费使用受速率限制
自行部署:🔴 极高|官方建议两张 H100 或一张 B200|开放权重限非商业用途
模型与接入文档:https://docs.cohere.com/docs/north-small-translate-1.0
发布说明与权重入口:https://docs.cohere.com/v2/changelog
★ Sierra Hyper-τ-bench
让编码 Agent 从业务资料中构建客服 Agent,再用真实业务风格的任务检验成品。
Sierra 于 9 月 8 日宣布开放 Hyper-τ-bench,将评测推进到 “Agent 能否构建出能用的 Agent”。开发者角色需要从政策文档、客服记录、截图、流程图和接口资料中整理需求,在沙箱中提交一个可执行的客服 Agent。
提交后,系统会用开发过程中未见的客服任务检验成品,评价它能否遵守业务规则并完成用户请求。任务覆盖航空、零售、电信和银行知识等领域,还允许开发者向模拟客户访谈,补全分散在资料之外的需求。
项目代码采用 MIT 许可证,提供任务数据、运行框架和结果查看工具。它适合评估编码 Agent 的需求理解、系统搭建与迭代能力;完整运行需要组合沙箱、被测模型和模拟用户等多个模型角色,并承担相应调用成本。
上手门槛
开发接入:🟡 中|提供评测框架与任务数据|需组合沙箱与多个模型服务
源码与上手说明:https://github.com/sierra-research/hyper-tau-bench
官方介绍:https://sierra.ai/uk/blog/hyper-t-bench-evaluating-agents-that-build-agents
★ NVIDIA CUDA Rust:cuda-oxide / cutile-rs
用 Rust 编写 GPU 内核,分别通过线程级控制与 Tile 级计算组织并行任务。
NVIDIA 于 9 月 8 日介绍 CUDA Rust 的两条开发路线,让使用 Rust 构建推理引擎和系统基础设施的团队,也能用同一种语言编写 GPU 内核,并将所有权与内存访问约束延伸到 GPU 执行过程。
cuda-oxide 面向 SIMT 编程,开发者描述单个线程的行为,保留对线程和内存的细粒度控制;cutile-rs 面向 Tile 编程,按数据块描述计算,由编译器安排线程映射。两者提供了不同抽象层次的选择,适合结合已有算子和系统需求评估。
目前两条路线都有代码、文档与运行示例。NVIDIA 明确表示,两者仍处早期,尚未达到生产就绪状态:cuda-oxide 属于早期 Alpha,cutile-rs 已有外部项目使用,但仍可能出现功能缺失和 API 变动。本次适合作为 GPU 开发生态进展关注。
上手门槛
开发接入:🔴 高|需适配 GPU 编译工具链|两条路线均处早期,API 可能变动
cuda-oxide 文档:https://nvlabs.github.io/cuda-oxide/
cutile-rs 文档:https://nvlabs.github.io/cutile-rs/
cuda-oxide 源码:https://github.com/NVlabs/cuda-oxide
cutile-rs 源码:https://github.com/NVlabs/cutile-rs