阅读,与值得关注的内容Readance

前沿观察:五千字长文看2026年9月半月度发生了什么?技术、项目、产品、趋势四角度

今天是2026年9月19日,星期六,北京,天气晴。

2026年的9月已经过半了,来做半月度总结,得益于社区有每日早报的习惯,有技术侧和资讯情报侧的两个渠道,所以,可以以半月度和月度的积累材料为输入,进行总结

说干就干,基于《老刘说NLP技术进展早报》(9/01–9/18,深度视角)与《AI情报简报》PDF(9/01–9/19,新闻事实面)的跨源综合研判,来做本次总结,供各位参考,看下过去半个月发生了什么

分别从技术层面、产品层面、项目层面、趋势层面4个角度进行解读。

相信积累的力量,不断总结再总结,总会有所收获。

一、技术层面

本半月技术主线收敛,包括模型能力、训练范式、知识工程(本体论)、Agent基础设施、安全治理五条线索彼此咬合。具体的可以分成如下几点:

1、模型能力层:竞争标尺从"参数规模"转向"长程自治+具身/工具行动"

Astra驾驶无人机、独立经营一门生意(Vending-Bench六次均赚15515美元);

ClaudeFable5.1强化长程Agent任务、并参与费马大定理机器形式化证明;

DeepSeekV4.1Flash以552B参数但仅8B/16B激活实现原生多模态

GLM-6.0走"全自训练(FullySelf-Training)"路线;

从第一性原理来看,模型价值的决定因素从"静态基准分数/参数量"转为"在真实或受控环境里,能否独立完成多步任务并产出可验证结果"。参数规模退居二线,但并非无关,它仍是承载长程推理与多模态的基础。

借此,可以看到结论:在现有证据下,模型竞争已进入"行动层",标尺是长程自治能力与具身/工具执行能力,而非单纯的对话或榜单表现

但是,需要注意的是:

演示≠生产可靠。Astra经营生意发生在受控基准环境,迁移到无脚本的真实商业场景,失败模式与成本结构未知;

能力外溢有边界。长程任务的"自治"仍受上下文长度、工具可用性、权限边界约束;"驾驶无人机"属受控演示,不等于通用具身智能成熟;

特别的,也有一些观点认为参数与后训练算力仍是天花板,多模态与Agent能力本质是更大规模训练的副产品,二者并非替代关系

2、训练与架构范式:后训练成为Scaling的一部分,评估取代更新成为瓶颈

过去半个月,大模型发布的趋势表现在:发布节奏加快,能力标签从"参数/榜单"转向"行动/多模态/国产算力",如下图所示(注意,这个是部分模型):

展开看几点变化:

架构侧。循环Transformer(Astra隐藏推理)、Causal-Encoder-Decoder(DeepSeekV4.1)、MoE稀疏激活(8B/16B激活)共同指向"用结构换算力效率";

训练侧。GLM"全自训练"把"生成任务环境→在环境中训练→优化系统→承载更强模型"闭合为自驱循环;

RSI(递归自我改进)综述指出更新机制早已不是瓶颈,评估才是,评估环是整个系统唯一不能靠自身能力解决的环节

也就是,在现有证据下,训练范式的焦点正从"如何改自己"转向"如何为改进提供可信锚点"。

同样的,在不足方面,也是需要警醒,虽然RSI很火,但目前还处于初级阶段,依旧有很多问题:

一来,FST有收益也有瓶颈。前期有效,后期易进入瓶颈期,需人工把控预测质量、循序渐进;

二来,RSI演示停在结构层。多数"递归自我改进"改了机制并继承,但无证据表明改后的机制确实产出更强后继;

三来,锚的可信度分层。环外锚(编译器/测试/实验/客观指标)较可信;环内锚(LLM自评)易退化。真正前沿在"造出AI骗不过的裁判",而非"让AI改自己"。

3、知识工程与本体论:本半月最密集主题,本体成为Agent时代的"受控演化语义锚点"

社区在这个月新增了不少内容,包括PalantirFoundry三部曲(DataIntegration/Ontology/AIP)与Gotham情报分析蓝皮书(261页、25章)被系统拆解

OAG(本体增强生成)被定义为"责任架构",用本体强类型约束事实、用工具调用分离概率与确定性、用权限与审计包住行动;

task-specific范式主张"固定静态本体是Agent天花板,本体须随任务/数据/Agent行为受控演化";

这种方案的立足点在于,LLM输出是概率性的,而企业决策要求确定性、可追责、可审计。本体提供"不变的语义约束层",把概率性生成锚定在业务对象、关系、规则之上,从而让"AI参与业务决策"在责任上变得可接受

因此,在现有证据下,本体论升温的本质,是行业在寻找Agent落地的"语义锚点" ;其形态正从静态知识描述走向"随任务受控演化的可执行结构"。

但是,正所谓浑水摸鱼,还是有很多事情需要去正视,例如:

其一,"自进化"是营销话术。Foundry的"本体自进化"实为"持续受控演化",驱动力是人+流程,不是本体自行重构schema。应区分"受控生长"与"自主自我修改" 

其二,"国内版Palantir"需审慎。"国内不是缺少Palantir的技术,而是缺少Palantir的用户"。更准确地说,是需求侧成熟度(愿持续投入、开放真实场景的客户)与供给侧技术能力之间存在错配,而非单纯"缺技术"

其三,评测风险。当LLM成为本体匹配/学习的常规手段,"训练集污染"从个别现象变为系统性评测漏洞(LLMs4OL学习、OAEI对齐构成语义网两条主线,但污染问题需正视);

其四,信息差窗口。本体论若被当作"花"而非"锦"来卖,待信息差打平后价值将快速重估;有真实业务、长期做定制化方案者受影响较小。

4、Agent基础设施:可靠工具调用依赖"沙箱+记忆+可观测"闭环

关于这一点,先说结论,结论:Agent的可用性瓶颈正从"模型聪明"转向"工程闭环可靠",沙箱、记忆、可观测性成为基础设施。

可以展开看下几个支撑论据:

一个是Harness工程:确定性harness、ClaudeCodeProjects(对话式多线程、并行开PR)、MuseforMac/桌面Agent(WorkBuddy登陆麒麟/UOS、统信、openKylin、deepin)体现"把一切重写为Agent可消费"的工程重构;

一个是记忆与自进化:社区手搓SQLite记忆循环(提取→存储→检索→注入)把"记忆"从黑盒拆为可替换工程问题;Aspire/S3Gym/HarnessDev探索Agent自我演化;

一个是RAG与文档解析:WeKnora0.8.0引入会话持久化SkillSandboxRuntime(Docker/E2B/CubeSandbox三后端);MinerU4.0支持4种解析模式、定位器渐进式读取、AMD适配;文档OCR趋势为"小而美+端到端+RL喂质量"。

这些都是Agent方向的进展,但是有一些误区需要做个澄清:

一来,"RAG已死/Skills杀死MCP"是伪命题。GitHubPodcast结论为"AI只是移动工作量",MCP解决连接、Skills解决能力封装,二者解决不同问题,非替代关系;

二来,沙箱非万能。bash不再是可靠工具调用的"allyouneed",但"沙箱+bash仍适合真正的工程活";间接trick模型不如直接给合适形状的工具。

三来,自进化仍处早期。演示多、生产少,需以评估环约束。

二、产品层面

产品层面的关键,不是"又发了什么功能",而是商业闭环是否成立、护城河在何处、以及Agent从对话走向交易时信任基建如何补位。

1、模型产品化与商业化:双轨汇合,但现金流结构分化

按照发布的财报来看,智谱API收入占86.5%,往"按任务结果付费"走(卖结果);MiniMax海外收入占60.8%、企业客户超200万,压低单位智能成本铺开(卖规模)。两路线最终在"既能把事办完、又便宜到大规模用"汇合。

又如,FT泄露PPT显示OpenAI预计2026–2030累计负自由现金流2780亿美元,收入从今年360亿增至2030年3500亿,但五年总收入8400亿低于算力支出8560亿

因此,在现有证据下,头部实验室处于"高成长、重资产、负自由现金流"阶段,这是扩张期的结构性特征,不等于经营即时不可持续。

但是,看商业模式,需要区分两层:"叙事驱动的高估值"(依赖未来现金流折现)与"现金流不可持续"(短期偿付危机)。FT数据揭示的是成本结构风险(算力支出>收入),而非即时违约。

也有不同的声音认为,若算力价格下降慢于模型商品化速度,"卖规模"路线可能陷入价格战,单位经济模型未必成立。

2、企业AI落地产品:模型解决不了"工作流最后一公里"

事实上,这个点已经被讲烂了,在现有证据下,SaaS未被吞噬,反而因原生集成大模型+FDE替企业产出而增强;模型能力越强,数据/身份/权限/治理的价值越凸显

AIP=受治理地把LLM接进企业本体与业务流程(差异化在"本体打通+动作可执行+全程治理",模型是commodity);

FDE(前台部署工程师)以2×2矩阵判定"卖的东西复杂×买家非技术"才需驻场;

SaaS板块中Crowdstrike/Palantir/Snowflake超预期,Salesforce流失率近历史最低,反驳"AI吞噬SaaS"。

企业工作流的"最后一公里"是数据、身份、权限、治理,这些是组织资产而非模型能力,模型无法凭空生成

但这个需要辩证的看,抛出几个点:

一个是2B>2C。国内2CAgent付费用户规模有限,月活意义不大;商业化势能更多在2B(如飞书借汽车行业积累成为豆包工作的现实起点);

一个是受限于环境。企业数据化基础差、付费意愿低、标准化产品适用范围受限,仍是Agent落地胜负手;

一个是FDE需回传情报。只解决现场问题、不把信号反哺产品团队的FDE,本质是"换个头衔的咨询团队",长期价值有限。

3、开发者与创作者工具:护城河在"关系/磨合",不在"数据/单点效果"

关于壁垒的问题,其实一直是大家关注的点。

一个突出的结论是:"价格买不来护城河",模型替换宽容度(Harness层指标)与关系沉淀,比单点效果更决定留存。

ClaudeCodeProjects、CodexCLI、Copilot将runtime迁至Rust(80万行、128个PR,"用Copilot写Copilot")、Muse、CalibreAI写作;

标准化工具赛道单点效果领先仅维持1–2个月,迁移成本近乎为零(甚至能自动扫描并搬走ClaudeCode配置)。

效率工具产物是开放标准格式,数据可被瞬间克隆;真正带不走的是用户与Agent长期沉淀的双向磨合成本(脾性、暗语、排版习惯、信任)。

但是,这种效果仍可覆盖惯性,程序员愿为新模型重学一周快捷键,"关系"护城河对纯效率场景弱于对陪伴/生产型关系场景。

三、项目层面

老刘说NLP社区完成多部一手资料系统化产出,同时多个开源项目构成可验证的工程参照

的确,在半个月一来,社区是做了多个产出,如下:

但是,这些产出的方法论意义在于"从一手官方文档出发做本地化重组",降低了中文社区接触Foundry/Gotham技术体系的门槛;其结论是否经得起工程验证,仍需以开源复现项目对照检验,不宜直接等同于"可落地方案"。

在开源项目方面,过去半个月其实有了多个,例如:

openbkn-ai 基于本体知识网络的供应链业务问答/推理,准确率宣称稳定100%(PR阶段);

Utopia企业级知识图谱系统,重点在时序性;据早报研判,本质仍属GraphRAG谱系,宜直接读GitHub而非依赖自媒体;

WeKnora(腾讯)RAG框架,0.8.0引入会话持久化SkillSandboxRuntime;

MinerU4.0/ninfer/stealthprint做文档解析、单卡推理优化、模型指纹识别。

但是,需要注意的是,在2026年了,不要再被指标忽悠,"100%准确率"需看场景:供应链问答在特定PR阶段达100%,不等于通用域鲁棒,需区分"限定域"与"开放域" 

四、趋势层面

来看看几个趋势以及辨证分析,4点:

1、本体论升温,本质是寻找Agent落地的"语义锚点"

OAG责任架构、task-specific范式、Foundry三部曲拆解共同指向,LLM概率性需被企业确定性约束。本体不是复古知识工程,而是Agent时代的受控演化语义层。

但这个也存在不确定性:若未来模型确定性显著提升,"锚点"形态可能变化;当前判断基于现有概率模型前提。

2、自进化叙事被"评估瓶颈"去魅,真前沿在"造AI骗不过的裁判"

RSI综述"更新机制非瓶颈、评估才是";多数演示停在结构层;环内锚易退化。资源应投向可信评估体系,而非更新的自动化。但是,若出现稳定环外客观指标,"自进化"可行性或上修;此为开放问题。

3、工作流"最后一公里"是SaaS韧性的来源,模型未吞噬软件

Salesforce流失率历史最低、Palantir/Crowdstrike/Snowflake超预期;FDE2×2矩阵。进而可以得到结论:数据/身份/权限/治理是组织资产,模型无法凭空生成,故SaaS借AI增强而非被替。不确定性:若Agent原生协议(A2A/本体)成熟到绕过传统SaaS,结论需再审。

4、安全问题需要达到平衡

最近的出现的一些事情,包括Gemini入侵三公司、ZCode上传.git、美军幻觉误判、Claude入侵OpenAI。结论:权限/审计/对齐是系统可用性前置条件,与OAG的权限审计层同源。但是,过度治理可能抑制创新速度,需在"可信"与"敏捷"间取动态平衡。

关于我们

老刘,主页:https://liuhuanyong.github.io。

对知识图谱本体论、Agent记忆及架构、RAG知识库等技术方向感兴趣,欢迎加入社区,社区持续纳新。

加入社区方式:关注公众号,在后台菜单栏中点击会员社区加入。



前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →