阅读,与值得关注的内容Readance

DeepSeek正式发布V4.1 Flash并开放权重,蚂蚁百灵开源Ling-3.0-flash-VL多模态模型

9 月 10 日,今天值得关注的项目覆盖多模态模型、机器翻译、Agent 评测与 GPU 开发:DeepSeek V4.1 Flash 正式发布并开放权重,蚂蚁百灵开放视觉模型,Cohere 推出专用翻译模型。开发工具方面,Sierra 将评测对象扩展到“构建 Agent 的 Agent”,NVIDIA 则介绍了 Rust 编写 GPU 内核的两条路线。


👁️ 多模态理解与执行


★ DeepSeek V4.1 Flash

原生理解图像与文本,通过新架构压缩长上下文缓存,支持推理、编程与工具调用任务。

DeepSeek 于 9 月 10 日正式发布 V4.1 Flash,API 同步上线,模型权重采用 MIT 许可证开放。新模型原生处理图像和文本,支持最高百万 Token 上下文,可用于看图分析、代码开发和需要连续调用工具的任务。

这次更新采用新的因果编码器—解码器架构,并通过跨层共享与压缩减少 KV 缓存占用。模型卡列出的主干参数量为 552B,输入预填充和解码阶段分别激活 8B、16B 参数。设计重点是提高输入较长、需要反复读取上下文的 Agent 工作流效率;自行部署仍需按完整权重及附加组件配置资源。

开发者将 API 模型名设为 deepseek-flash,即可调用正式版。官方同时宣布,9 月 14 日北京时间 12:00 后,原 deepseek-v4-pro 请求将路由至 V4.1 Flash,并按 Flash 单价计费,直至后续 V4.1 Pro 上线。

上手门槛

开发接入:🟢 低|使用官方 API|正式版模型名为 deepseek-flash

自行部署:🔴 极高|已开放 FP8 权重|552B 主干及附加组件,需要大容量内存与多卡部署

API 文档:https://api-docs.deepseek.com/zh-cn/

模型权重:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash

更新说明:https://api-docs.deepseek.com/zh-cn/updates/


★ 蚂蚁百灵 Ling-3.0-flash-VL

理解图像、视频、文档与界面,并依据视觉反馈推进推理、工具调用和任务验证。

蚂蚁百灵近日宣布开源 Ling-3.0-flash-VL,开放 BF16 与 FP8 权重,采用 MIT 许可证。模型在 Ling-3.0-flash 基础上加入原生视觉能力,将图像和视频信息用于理解、推理、行动与结果检查。

它既能处理图表、复杂版式和文档内容,也能理解网页及软件界面,为后续操作提供依据。对于需要观察执行结果的 Agent,视觉输入可以帮助模型判断当前状态、发现偏差,再决定下一步动作,适合探索文档分析、界面自动化与视觉辅助开发。

项目提供模型权重和推理说明,官方平台也已提供多模态 API。自行部署的长上下文参考方案采用多张数据中心 GPU;开发者可以先通过 API 验证业务效果,再评估私有部署成本。

上手门槛

开发接入:🟢 低|提供 OpenAI、Anthropic 兼容 API

自行部署:🔴 极高|权重已开放|官方长上下文参考方案采用多张数据中心 GPU

API 文档:https://developer.ant-ling.com/en/docs/tutorials/multimodal-understanding/

BF16 权重:https://huggingface.co/inclusionAI/Ling-3.0-flash-VL

FP8 权重:https://huggingface.co/inclusionAI/Ling-3.0-flash-VL-fp8


🌐 多语言翻译


★ Cohere North Small Translate

面向文档、产品内容与客户沟通提供专用机器翻译,覆盖 50 多种语言及地区变体。

Cohere 于 9 月 9 日发布 North Small Translate,将机器翻译作为专门优化的任务。它支持简体中文、繁体中文、英语、日语等 50 多种语言及地区变体,可接入内部知识库、技术手册、产品本地化和多语言客服流程。

模型采用 MoE 架构,总参数为 218B,激活参数为 25B,上下文窗口为 16K。Cohere 提供 Chat V2 API,免费使用受速率限制;对于关注数据存放位置的团队,也提供开放权重与商业私有部署路径。

需要注意,FP8 权重采用 CC BY-NC 4.0,仅限非商业用途。企业生产部署需另行购买商业许可,并可通过 Model Vault 部署。官方建议硬件为两张 H100 或一张 B200,名称中的 Small 并不意味着普通电脑即可运行。

上手门槛

开发接入:🟢 较低|提供 Chat V2 API|免费使用受速率限制

自行部署:🔴 极高|官方建议两张 H100 或一张 B200|开放权重限非商业用途

模型与接入文档:https://docs.cohere.com/docs/north-small-translate-1.0

发布说明与权重入口:https://docs.cohere.com/v2/changelog


🧪 Agent 构建评测


★ Sierra Hyper-τ-bench

让编码 Agent 从业务资料中构建客服 Agent,再用真实业务风格的任务检验成品。

Sierra 于 9 月 8 日宣布开放 Hyper-τ-bench,将评测推进到 “Agent 能否构建出能用的 Agent”。开发者角色需要从政策文档、客服记录、截图、流程图和接口资料中整理需求,在沙箱中提交一个可执行的客服 Agent。

提交后,系统会用开发过程中未见的客服任务检验成品,评价它能否遵守业务规则并完成用户请求。任务覆盖航空、零售、电信和银行知识等领域,还允许开发者向模拟客户访谈,补全分散在资料之外的需求。

项目代码采用 MIT 许可证,提供任务数据、运行框架和结果查看工具。它适合评估编码 Agent 的需求理解、系统搭建与迭代能力;完整运行需要组合沙箱、被测模型和模拟用户等多个模型角色,并承担相应调用成本。

上手门槛

开发接入:🟡 中|提供评测框架与任务数据|需组合沙箱与多个模型服务

源码与上手说明:https://github.com/sierra-research/hyper-tau-bench

官方介绍:https://sierra.ai/uk/blog/hyper-t-bench-evaluating-agents-that-build-agents


⚙️ GPU 内核开发


★ NVIDIA CUDA Rust:cuda-oxide / cutile-rs

用 Rust 编写 GPU 内核,分别通过线程级控制与 Tile 级计算组织并行任务。

NVIDIA 于 9 月 8 日介绍 CUDA Rust 的两条开发路线,让使用 Rust 构建推理引擎和系统基础设施的团队,也能用同一种语言编写 GPU 内核,并将所有权与内存访问约束延伸到 GPU 执行过程。

cuda-oxide 面向 SIMT 编程,开发者描述单个线程的行为,保留对线程和内存的细粒度控制;cutile-rs 面向 Tile 编程,按数据块描述计算,由编译器安排线程映射。两者提供了不同抽象层次的选择,适合结合已有算子和系统需求评估。

目前两条路线都有代码、文档与运行示例。NVIDIA 明确表示,两者仍处早期,尚未达到生产就绪状态:cuda-oxide 属于早期 Alpha,cutile-rs 已有外部项目使用,但仍可能出现功能缺失和 API 变动。本次适合作为 GPU 开发生态进展关注。

上手门槛

开发接入:🔴 高|需适配 GPU 编译工具链|两条路线均处早期,API 可能变动

cuda-oxide 文档:https://nvlabs.github.io/cuda-oxide/

cutile-rs 文档:https://nvlabs.github.io/cutile-rs/

cuda-oxide 源码:https://github.com/NVlabs/cuda-oxide

cutile-rs 源码:https://github.com/NVlabs/cutile-rs

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →