卓哥投研笔记公众号文章

开源与闭源模型:差距重新拉大,蒸馏变难了?

卓哥投研笔记

公众号 · 28 篇文章

DeepSeek R1之后,开源模型最高光的时间段是今年6-7月份,智谱发了GLM5.2,能力接近Opus 4.6;Kimi发了K3,能力接近Opus 4.8。
当然,你可以说开源模型预训练还不扎实,深度逻辑能力比OA弱,也可以说K3能力虽强,但速度和成本还有待优化。但那个时候,不少投资人认为开源模型与OA的差距缩短至3个月(K3发布时间只比Opus4.8晚不足2个月)。
最近两个月,北美那边神仙打架,O家发了GPT-6 Astra,快速追上A家;A家发了Opus 5.5,并重新开始重视低价模型,最近还发了Haiku 5.5,说实话,Haiku和Luna有点伤国内开源模型出海逻辑;谷歌发了Gemini-4 Argon,看分数,重新回到第一梯队。
开源模型最近几个月略显平淡,GLM-5.3并没有追上Fable,大概还是Opus-4.8的水平。Opus-4.8是今年5月发的,差距被重新拉大到6个月左右。近期调研显示,相关技术社区约75%参与者认为开源与闭源的差距重新拉大。
有一种解释是,8月开始,OA两家增加了反蒸馏措施。不是说不能蒸了,而是蒸馏难度上升,部分业内人士认为,蒸馏成本上升了10倍。比如GPT-6不再直接展示思维链,迫使蒸馏方必须采用更多轮次的提问,来还原GPT的思考路径。原先通过2-5轮次交互就能获取的信息,现在可能需要10次、30次,导致API调用成本直接上升5倍以上。
另外,A➗对刨根问底式追问非常警觉,一旦被判定为蒸馏行为,就会封号。所以,蒸馏方需要提一些无关问题,来混淆Claude的判断,直接增加API成本,但依然无法根除封号。那就需要买更多新账号,这也会增加API成本。
业内专家认为仅API购买成本就上升了5-10倍,这还不算增加的人力、算力成本,以及需要耗费更多时间。
当然这只是部分业内专家和二级投资人的看法,谱子不是这么看的。
在9月的交流中,谱子说蒸馏是昨天的故事了,比如去年时,OAI和Meta都有上万人的数据标准团队,谱子只有500-600人,那这个时候借借力很正常。到coding时期,早期数据来源并非人工标注,而是GitHub上的公域数据,谱子说,这个时候,蒸馏的重要性已经被弱化。
今天,谱子说大家已经不拼数据标注了,而是拼环境搭建。比如法律场景,需要10万个以上的真实法律环境;网安也需要至少几万个网安环境的搭建。而中美之间,法律和网安都是异构的,中国律师和美国律师走的程序差异很大。然而相比美国,中国在搭建真实环境和标注上,有人力成本优势,存在弯道超车可能。
另外关于GPT-6的隐式思维链导致蒸馏难度变高的问题,谱子觉得这并不是OAI为了防蒸馏,把思维链藏起来不给别人看,而是一个OAI自己都没有解决的bug,会影响自家模型的安全对齐。谱子暗示,OAI在想办法解决这个问题。
总体来说,谱子并不认为OA的反蒸馏会影响开源模型前进步伐。
至于是否会影响,4季度是重要观测期。野村请的大模型专家说,K家预计在10月中旬前发一款新模型,不是靠堆参数,而是靠后训练+computer-use轨迹+真实任务数据,硬拉长程agent能力。谱子估计也要祭出GLM5.5,不少卖方认为是总参数1.5-2T的模型,相比5.3,能力会有显著提升。此外,Qwen4.0、Hy4正式版预计也会在本季度亮相。
看哪家国模会率先缩短与海外SOTA的差距。
欢迎扫码加入卓哥的星球/群学习知识、交流信息。星球用户送卓哥微信群。
图片

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →