👦🏻 作者: GaKi
🥷 编辑: Koji
🧑🎨 排版: NCon
7 月 24 日,黄仁勋在 X 上发布了自己的第一条推文,附带一封联名公开信,标题是 《开放权重与美国在 AI 领域的领导地位》 ,几天内,联署名单增加到 150 多家,包含了 OpenAI 和 Google 。
这封信发布时的一个直接的背景,是中国开源模型这一年的进展。
过去几个月,国内发布了多款相当不错的开源模型,像是 2.8 万亿参数的 Kimi K3、Qwen3.8-27B、Step 5 Preview(预计 10 月开放权重)。这些都是大语言模型,也吸引了行业大部分的注意力。
但真正值得注意的变化,已经不只发生在大语言模型上。
9 月中旬,网易有道开源了两款实时语音模型 R2T2 和 T3PO。R2T2 负责实时语音转写,T3PO 负责实时翻译。发布几天后,两款模型分别登上 Hugging Face 的 ASR(语音识别)和 Translation(翻译)Trending 榜第一。
同一个月,OpenAI 开放了全双工语音模型 GPT-Live-1 的 API,Google 发布 Gemini 3.8 Live。
在海内外大厂的注意力同时集中在「实时语音」这个细分赛道的同时,网易有道获得了一个相当不错的成绩,这很不容易。
中国开源模型开始从最受关注的大语言模型主战场,继续往语音识别、实时翻译这些更细、更具体的技术环节里深入。而且,已经站到了榜单最前面。
所以,这两个模型上榜真正值得关注的,不只是「网易有道做出了两款不错的模型」。
更重要的变化是,中国开源模型的影响力,正在一层一层往整个 AI 技术栈里渗透。
本文将从这 2 款模型出发,讨论 2 个问题:
【1】「实时语音」这一个「相对大语言模型,注意力较低的细分赛道」为什么重要?
【2】网易有道为什么选择在这里一直坚持。
Hugging Face 在 2026 年 3 月发布了一份春季开源报告,显示过去一年中国模型占平台下载量的 41%,月度下载量和总下载量都超过了美国。
如果看中国模型在下载量上反超美国的时间点,则更早,是从 2025 年 7 月开始的。
2025 年 9 月,阿里 Qwen 超过 Meta Llama,成为 Hugging Face 上下载量最大的语言模型家族。按 Hugging Face 官方统计,基于 Qwen 开发的衍生模型超过 15 万个,比 Google 和 Meta 两家基础模型的衍生数量加起来还多。
下载量之外,模型聚合平台 OpenRouter 上,中国开源模型的 token 真实调用占比在 2024 年底还不到 1.2%,到 2026 年 4 月已经接近一半。
不过,这些数字里的大部分份额仍然来自通用大模型,比如 DeepSeek、Qwen、Kimi、GLM 。大家讨论的大多还是是参数规模多大、是不是 Dense 模型、有没有 1M 上下文,以及 Coding 和推理榜单上的分数。
但是,如果平常关注模型进程的话,会发现细分方向上的情况有所不同,尤其是「实时语音类模型」。
毕竟,开发者在 ASR、翻译等实时语音模型的细分榜单上下载一个模型,通常就已经准备把它集成到自己的产品里。
因此,某种角度来说,细分榜单更能反映具体场景里的真实需求。
开发者社区对 R2T2 和 T3PO 的反应,可以说明这一点。
先介绍下这两款模型。
R2T2 是一个流式语音识别模型,也就是人一边说话,它一边把声音转成文字,已经显示出来的字不会再被改动。
T3PO 则是一款同声传译模型,可以在中文和英文之间实时互译。
其中,R2T2 发布后,Hugging Face 开源团队的 Apolinario 在模型评论区发了一条帖子。
帖子里说:他们用 Agent 为 R2T2 做了一个交互 Demo,托管在 Spaces 上,运行在免费的 ZeroGPU 基础设施上,并提出把这个 Space 转交给有道。
有第三方开发者把 R2T2 移植到纯 C++ 的本地语音推理框架 audio.cpp 上,重新实现了它的流式状态机,还加入了本地麦克风实时识别。
这部分代码在 9 月 19 日合入了主仓库。
社区还为 R2T2 和 T3PO 制作了从 Q2 到 Q8 的多个 GGUF 量化版本。开发者可以用 llama.cpp 或 Ollama,在自己的电脑上运行这两款模型。
移植、量化、适配本地框架,这些工作都需要开发者投入一定的时间成本。有人愿意做,说明已经有团队准备在实际项目里使用它们。
所以,细分方向上的模型,也是开发者二次开发最集中的地方之一。
说完开源模型、尤其是「实时语音类」细分模型在开发商表现,接下来再聊聊「商业化场景」。
实时语音类模型,最大的商业场景之一就是 Voice Agent。
十个月前,「十字路口」团队曾经在《盘点:2025 年最值得关注的 18 家 AI Voice Agent 创业公司》一文中,详细梳理了这一赛道的初创团队,当时我们有个预测:
Voice Agent 指的是能听、能说,还能执行任务的 AI Agent,它可以在一通电话里帮用户完成预约、退款、下单这类多步骤操作。
2026 年了,这个方向的热度甚至比 2025 年还要高。
a16z 把「Voice Agent 从技术演示走向规模化部署」列为 2026 年的三大预测之一。吴恩达也公开说过,很多人低估了语音技术栈的重要性。
技术上的变化也集中在今年。
7 月,OpenAI 发布全双工模型 GPT-Live-1,替换了 ChatGPT 原来的高级语音模式。全双工的意思是,模型可以一边听一边说,会用「嗯」「对」回应,也能分辨用户是在思考停顿,还是已经说完。
语言学习公司 Speak 的测试显示,GPT-Live-1 误打断学习者思考停顿的情况,比轮次式系统减少了近 80%。
这是一个非常大的升级,也因此,很多人在各类社区平台中「吐槽」:
9 月,GPT-Live-1 开放 API,定价约 0.05 美元/分钟。加上电话线路和其他环节,一分钟 AI 通话的综合成本也已经低于人工客服。
实时语音类模型在 AI 硬件侧,也有着非常大的想象力。
AI 眼镜和耳机大多没有屏幕,语音是主要的输入和输出方式。Meta 与 EssilorLuxottica 在 2025 年卖出超过 700 万副眼镜,是前一年的三倍多。
EssilorLuxottica 2025 财报原文
这类硬件最常用的功能之一是实时翻译。Meta 的眼镜、Google 和三星的 Android XR 眼镜、苹果的 AirPods,都把实时翻译作为主打功能。
翻译场景对延迟非常敏感,毕竟你面前的说话人并不会等着你「思考、收听翻译」。
所以,Voice Agent 的难点集中在「实时」上。
有道首席科学家段亦涛在 9 月 16 日的有道 AI Open Day 上曾提到过一个观点:
因为,一条实时语音链路通常分为三段:
【1】语音识别把声音转成文字
【2】AI 理解文字并决定如何回复或翻译
【3】语音合成再把结果读出来
第一段的输出,决定了后面两段能不能及时开始工作,而这就是 R2T2 这个模型的领域了。
R2T2 这个模型最大的特点是「只增不改」,也就是:已经输出的字不再修改,新识别的内容只在末尾追加。
值得注意的是,「只增不改」之后,准确率并没有下降。
在网易有道团队内部 160 毫秒分块的测试中,以及在更接近真实场景的 AMI 会议数据集上,R2T2 所获得评分都相当不错:
延迟方面,R2T2 的平均识别延迟在 200 到 600 毫秒之间。
模型参数是 2B,量化后可以在个人电脑上运行。
眼镜和耳机的电池和算力都有限,这个体量的语音模型对硬件厂商很有实际价值。
另一方面,T3PO 则更擅长「在质量和延迟之间做取舍」。
T3PO 是一个 15B 参数的同传模型,支持中译英和英译中,可以提供低延迟、原生、高质量三档模式。
重要的是,它使用 Apache 2.0 协议,开发者可以免费商用。
两款模型串联使用,在真实的任务中会表现更好,比如语音输入后,R2T2 实时转写成文字,T3PO 实时翻译,最后输出字幕或合成语音。
以海外实时语音赛道为例,资金集中在两端。
一端是底层语音模型和实时音视频技术公司。ElevenLabs 在 2026 年 2 月以 110 亿美元估值融资 5 亿美元,Deepgram 和 LiveKit 也在今年初各自完成了 1 亿美元以上的融资。
另一端是企业客服应用。Sierra、Decagon、Parloa 三家公司在 2026 年上半年合计融资约 15.5 亿美元。
大厂也在进入下游,OpenAI 和 Google 直接提供低价的一体化语音 API,苹果和 Meta 把实时翻译做成耳机和眼镜的免费功能。
所以,处在中间层的独立公司压力最大,比如专做实时同传的创业公司 Palabra,今年 1 月的融资是 840 万美元,有些人认为这被低估了。
在这样的格局下,后来者需要选择一个具体的位置,并在这一个位置里建立自己的技术辨识度。
网易有道所选择的「实时识别和实时翻译」,目前来看和它过去的积累有关。
有道长期做词典、翻译和翻译笔这类产品,服务的都是查词、翻译、口语练习这些语言场景。所以它对语言数据、翻译质量和用户在真实场景中的需求,都有长期的积累。
2023 年,有道发布了教育大模型「子曰」。现在,它的模型矩阵已经覆盖多模态推理、翻译和语音交互。
在 9 月 16 日的 Open Day 上,有道把这次开源的两款模型归入「子曰 Live」系列。这个系列定位为实时交互模型矩阵,R2T2 和 T3PO 是首批发布的两款。
过去,外界对有道的印象更多来自词典、翻译和学习类应用。这次登上 Hugging Face 细分榜单的是两款底层模型,对应的是有道在语音方向上长期的模型投入。
这一部分工作,过去外界关注得比较少。
另一方面,大厂往往提供的是端到端的方案,也就是 Cover 掉语音输入,语音输出,中间过程开发者很难干预。
有道开源的是两个可以拆开使用的组件,开发者可以把 R2T2、T3PO 和自己选择的大模型、语音合成模型自由组合,也可以部署在自己的服务器上。
企业对这种可控性是有需求的,比如,语音 Agent 开发平台 Vapi 今年在 40 家竞争对手中赢得了 Amazon Ring 的订单。 Vapi 的做法是让开发者自行替换识别、大模型和语音合成模块。
Amazon Ring 没有直接使用大厂的一体化 API,说明大企业仍然看重对每个环节的控制。
回看这一年,中国开源模型的影响力仍在持续上升。
Kimi K3、Qwen 3.8 27B、Step 5 Preview 这些模型,让中国在开源大模型的前沿有了自己的位置。
现在,这种影响力开始向更细分的方向延伸。
Voice Agent 需要实时识别、实时翻译、全双工对话和端侧部署。每一项都是一个具体的技术问题,也都需要专门的模型来解决。
R2T2 和 T3PO 登上 Hugging Face 两个细分榜单第一,就是一个很有代表性的节点。
过去几年,海外开发者认识中国 AI,先是通过 DeepSeek、Qwen、Kimi 这样的通用模型。
接下来,他们很可能会开始通过一个语音识别模型、一个翻译模型、一个端侧模型,认识更多来自中国的 AI 团队。
中国开源模型已经不只是在最受关注的主赛道上竞争。现在,连那些更窄、更难被普通用户看到,却直接决定产品体验的技术环节,也开始出现中国模型的身影。
而 AI 真正进入产业之后,竞争会聚焦到一个个具体的问题,一个个具体的模型。
R2T2 和 T3PO,只是其中两个。