9 月 23 日,今天值得关注的项目覆盖编程与办公、图像设计、机器人推理和文档解析:Claude Opus 5.5 与 GPT-6 Sol / Luna 更新能力与价格,蚂蚁百灵开放设计生成和图层拆分模型,阿里 Logics-Parsing-V3 将解析能力扩展至跨页文档结构。
★ Claude Opus 5.5
加强长任务编程、电脑操作与专业办公,并降低持续运行智能体的成本。
Anthropic 发布 Claude Opus 5.5,重点提升代码库级迁移、调试、审查和长时间自主任务能力。官方称,新模型在多数工作上的表现达到 Claude Fable 5.1 水平,同时改进了沟通方式,让回答更早呈现关键信息,并更好地遵循用户指定的写作规则。
成本是此次更新的重点。API 每百万输入、输出 token 分别为 4 美元和 20 美元,缓存读取为每百万 token 0.20 美元。官方报告,在默认设置下,典型任务整体运行成本较 Opus 5 降低约 40%,输出速度提高超过 30%;整体任务成本与单个 token 的降价幅度是不同口径。
模型已向 Claude 付费用户及 API 开放,适合持续调用工具、处理代码与制作办公交付物的工作流。此次版本始终启用思考模式,部分受限制的专业任务会转交其他模型处理。目前未开放模型权重。
上手门槛
在线使用:🟡 中|需 Claude 付费套餐|受服务地区限制
开发接入:🟡 中|API 按量计费|账户与服务地区需符合平台要求
在线使用:https://claude.ai/
模型与接入说明:https://www.anthropic.com/claude/opus
发布说明:https://www.anthropic.com/claude-opus-5-5
★ GPT-6 Sol / GPT-6 Luna
以不同的能力与成本配置处理编程、专业工作和电脑操作,支持更大规模的日常调用。
OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,将 GPT-6 Astra 所采用的部分训练方法扩展到更快、更低成本的模型。Sol 面向较复杂的编程与专业工作,Luna 面向成本和调用量更敏感的日常任务,两者均更新了事实回答、电脑操作及协作表达能力。
API 价格方面,Sol 每百万输入、输出 token 分别为 2 美元和 10 美元,Luna 为 0.10 美元和 0.50 美元。此次还改进了提示缓存,并提供缓存监控、诊断和显式断点等能力,帮助长对话与智能体工作流减少重复处理上下文的开销。
两款模型已向相应订阅用户开放 ChatGPT Work、Codex 和 API 使用,Free 与 Go 用户可在桌面应用中使用 Luna。发布公告明确,普通 Chat 模式暂未提供这两款模型。API 模型名分别为 gpt-6-sol、gpt-6-luna,当前未开放权重。
上手门槛
开发接入:🟡 中|OpenAI API 按量计费|账户与服务地区需符合平台要求
开发者平台:https://platform.openai.com/
开发文档:https://developers.openai.com/
发布说明:https://openai.com/index/introducing-gpt-6-sol-and-luna/
★ 网易有道 Confucius4-R2T2
把持续输入的语音实时转成文字,已确认内容不回改,适合字幕与语音 Agent。
网易有道发布 Confucius4-R2T2,开放模型权重与推理代码。它基于 Qwen3-ASR 构建,面向实时语音转写,重点优化中文与英文,同时保留多语言识别能力。开发者可以处理完整录音,也可以连续发送音频,逐步获得识别文字。
模型的核心特点是只提交稳定的文字前缀,已确认输出不再回改,减少实时字幕反复修改、闪动的问题,也便于下游 Agent 及时处理转写内容。官方报告平均延迟为 200—600 毫秒,支持按场景调整音频分块,在响应速度与识别准确率之间取舍。
项目提供本地推理示例和 WebSocket 服务,可接入直播字幕、会议转写或语音交互系统。代码采用 Apache 2.0,模型权重采用网易自定义许可;达到协议规定的用户规模或营收门槛时,需另行获得授权,不能将其视为无条件商用的 Apache 2.0 权重。
上手门槛
自行部署:🟢 较低|提供 GPU 推理示例与 Docker 运行说明|可启动 WebSocket 转写服务
模型权重:https://huggingface.co/netease-youdao/Confucius4-R2T2
项目源码:https://github.com/netease-youdao/Confucius4-R2T2
★ 蚂蚁百灵 Ming-Image-0.1-Design / Design-Layer
生成界面、海报与信息图,并将平面设计拆成可独立编辑的透明图层。
蚂蚁百灵开放 Ming-Image-0.1-Design 系列,包含两款 6B 参数模型。Ming-Image-0.1-Design 面向界面、海报、信息图等视觉设计,强调文字密集画面中的布局与文字呈现,并支持生成透明背景图像。
配套的 Ming-Image-0.1-Design-Layer 用于把已经合成的设计图拆成可独立编辑的透明图层,便于后续调整元素、替换素材和重新排版。两款模型分别覆盖“生成设计”和“拆开再编辑”,适合接入设计工具及自动化内容制作流程。
代码与权重采用 MIT 许可,仓库提供两类任务的推理入口。官方当前验证的默认部署配置为单张至少 80 GiB 显存的 GPU,以 BF16 运行;这一完整运行条件不能仅根据 6B 参数量推断为消费级显卡即可直接使用。
上手门槛
自行部署:🔴 高|官方已验证配置为单卡至少 80 GiB 显存|提供 BF16 推理代码
生成模型:https://huggingface.co/inclusionAI/Ming-Image-0.1-Design
图层拆分模型:https://huggingface.co/inclusionAI/Ming-Image-0.1-Design-Layer
项目源码:https://github.com/inclusionAI/Ming-Image
★ 阶跃星辰 Step Code
在终端完成代码阅读、修改与测试,支持长任务托管、定时执行和静态网站发布。
阶跃星辰开源终端编程智能体 Step Code。开发者进入项目目录后,可通过自然语言提出任务,由工具读取代码、修改文件、执行命令并运行测试,也可通过无交互模式接入脚本和批处理流程。
Step Code 提供长任务托管与定时执行,并支持子智能体、MCP、Agent Skills 和插件。内置 StepPage 能将本地静态页面发布为可分享的网址,支持版本管理与回滚,让代码修改、验证和页面交付在同一套工作流中完成。
项目采用 MIT 许可,提供 macOS、Linux、WSL 安装器,Windows PowerShell 支持目前处于 beta。当前默认产品入口仅内置 Step 服务,支持 Step Plan 订阅或 Step Platform API 计费;工具代码开源,模型调用仍依赖所接入的服务。
上手门槛
开发接入:🟢 较低|官方终端安装器|使用 Step 订阅或按量计费服务
安装与使用说明:https://github.com/stepfun-ai/Step-Code/blob/main/README.zh-CN.md
项目源码:https://github.com/stepfun-ai/Step-Code
★ APXinf-robo
在 Jetson 等设备上运行机器人视觉语言动作模型,并通过兼容接口接入现有控制系统。
RLinf 开放 APXinf-robo,围绕 ApxInf 端侧推理引擎提供机器人策略运行能力。首个版本重点优化 π0.5 视觉语言动作模型,覆盖 Jetson Thor、Orin 与部分桌面 NVIDIA GPU,并提供 BF16、FP8、INT8 等精度路径,具体支持范围随硬件而异。
项目方报告,在双视角输入、10 步动作采样和批量为 1 的配置下,Jetson AGX Thor 的 FP8 稳态模型推理中位延迟为 41.16 毫秒;相应 FP8 配置在 LIBERO-10 的 500 次任务测试中取得 92.2% 成功率。延迟属于指定模型推理配置,不能直接等同于机器人感知到执行的完整控制周期。
项目提供 Python 接口和 OpenPI 兼容服务,可将图像、任务指令与机器人状态转换为动作序列,并附带模型迁移工作流。代码采用 Apache 2.0 许可,模型检查点需要另行下载;实际运行需针对目标 GPU 构建,FP8 路径还需要相应校准数据。
上手门槛
自行部署:🔴 高|需针对目标 NVIDIA GPU 编译|另备模型权重,实机接入需适配机器人观测与动作接口
安装与快速入门:https://github.com/RLinf/APXinf-robo#quick-start
项目源码:https://github.com/RLinf/APXinf-robo
★ 阿里 Logics-Parsing-V3
解析多页 PDF 与图片,恢复标题层级、跨页内容和图文关联,输出结构化文档。
阿里发布 Logics-Parsing-V3,将此前的单页识别扩展为结构化长文档解析。这款 0.8B 视觉语言模型在逐页处理时传递紧凑的结构状态,保留前文关系,逐步恢复整份文档的层级,不要求将完整文档一次性放入上下文。
模型能够恢复标题层级、合并跨页元素,并建立视觉内容与相关文字之间的联系,同时支持复杂版式、科学公式和化学符号。输入可为单页图片、多页 PDF 或页面图片目录,输出包括 Markdown 正文、文档大纲和带元数据的 JSON,适合接入知识库、文档检索与资料整理流程。
项目方报告,在 NVIDIA H100、批量为 1 的 MPDocBench 测试中,V3 平均每页处理时间为 1.39 秒,该成绩对应窗口大小为 3 的配置。仓库采用 Apache 2.0 许可,并提供权重下载与推理脚本;公开测试硬件代表评测环境,不应当作最低部署要求。
上手门槛
自行部署:🟢 较低|0.8B 权重与推理脚本已提供|基于 vLLM 处理图片及多页 PDF
模型权重:https://huggingface.co/Logics-MLLM/Logics-Parsing-V3
魔搭模型:https://www.modelscope.cn/models/Alibaba-DT/Logics-Parsing-V3
源码与使用说明:https://github.com/alibaba/Logics-Parsing