阅读,与值得关注的内容Readance

DeepSeek-V4.1-Flash架构,Context的重整化

 

DeepSeek-V4.1-Flash发布,开始把Context从Token序列转化为计算状态。

传统 Transformer 面对长度为  的Context,全注意力计算量为 ,KV Cache则随  增长。


经笔者大模型数理原理分析,V4.1-Flash 的核心思路,是沿深度、空间、时间和数值精度不断压缩 Context 的有效自由度。

CED:沿深度重整化Context

V4.1-Flash 引入 Causal Encoder-Decoder(CED),将网络分成前后两个阶段。

Causal Encoder 先对 Context 做因果编码,形成中间状态;Decoder 基于这一状态生成 Token,使超长 Context 不必以原始序列形式贯穿整个网络。

更重要的,CED 引入了输入与输出的非对称计算,

Prefill 每个 Token 激活约 8B 参数,Decode 激活约 16B 参数。读取长 Context 时采用较低计算预算完成粗粒化,生成 Token 时投入更多计算资源。

用 RG 语言,CED 可以理解为沿网络深度对 Context 做粗粒化,从高维 Token 序列提取后续推理所需要的有效表征。

Engram:静态记忆与动态状态

V4.1 扩大了 Engram 静态记忆,约 196B 参数。高频、确定性的 N-gram 模式可以直接通过 Lookup 获取,减少它们反复进入主干网络进行动态计算的需要。

这样,模型形成两条记忆路径,Engram 保存相对稳定的静态关系,CED 与 KV Cache 保存当前 Context 的动态状态。

这相当于把一部分已经稳定的关系固定下来,把仍需根据上下文演化的关系留在动态状态空间中。

CSA2:沿深度复用关系

CED 完成 Context 的粗粒化,CSA2 进一步减少网络深度方向上的重复计算。

Attention 可以拆成两个问题,Indexer 决定去哪里找,KV 决定那里有什么。

CSA2 根据不同层的变化程度,在 Full、Reuse 和 Reindex 之间切换,使变化较小的层复用已有关系,只对发生变化的部分重新计算。

RG 视角,网络深度上的表征逐渐形成相对稳定的富集范畴;后续层无需重新构造全部态射,只需更新发生变化的局部关系,TTT时同理。

Indexer:沿空间筛选态射

超长 Context 的另一个瓶颈,是 Query 面对的关系空间过大。V4.1 通过层次化 Indexer,先进行候选关系的粗筛,再选择 Top-K,将平坦搜索转化为分层检索。

它没有消除 Context 长度带来的搜索依赖,只是把完整关系图逐步粗粒化,只保留当前 Query 所需要的有效态射。

所以,稀疏 Attention 的核心可以理解为,减少关系自由度,不简单减少Token。

Replay:沿时间管理状态

Context 还有时间维度。历史状态没有必要始终保持最高分辨率,Bounded Replay 只保留有限范围的局部状态,需要恢复时再进行重放。

这与Memory 保存关系,Recall 采样过去高度一致。过去不必完整驻留在当前计算空间,只需要作为可恢复状态存在。

FP4:压缩状态的物理表征

经过 Context 粗粒化、静态记忆剥离、跨层复用和关系筛选后,仍需保存的 KV 状态,再通过低位宽表征进一步压缩。算力不足不得已。

这样会形成一条连续的信息压缩链,减少状态数量,减少重复计算,缩短状态生命周期,再降低单个状态的存储精度。

CED、Engram、CSA2、Indexer、Replay 和 FP4 不是彼此孤立的优化,它们共同控制 Context 状态的生成、表征、检索、复用、生命周期和存储。

V4.1:从Token到状态,从状态到范畴

CED 沿深度完成 Context 粗粒化,Engram 固化稳定关系,CSA2 沿深度复用关系结构,Indexer 沿空间筛选有效态射,Replay 沿时间管理状态,FP4 最后压缩其物理表征;

加上曾详细解读的mHC,DeepSeek mHC:一次将 Transformer 残差流拉回重整化轨道的重大升级,形成了一条“Token-表征-关系-状态-采样”的重整化流。

V4.1-Flash 的重要变化,是这种“表征-关系-采样”的结构开始直接进入推理计算。Context 不单是模型需要处理的一串 Token,还逐渐成为可以被重整化、复用、检索、重放和压缩的关系状态。

学习过程是重整化,学习结果是富集范畴,推理是采样逆重整化。Causal Encoder 是 RG,CSA2 是从表征空间进入富集范畴的入口,Decoder 是采样逆重整化。

到今天 V4.1-Flash,DeepSeek 终于实现了笔者一直期待的原生多模态,DeepSeek 将开启多模态“信息动力学”新范式。V4.1-Flash是笔者理想的大模型架构的第一个完整实现。如果后续再用Wasserstein距离替换KL就完善了。

笔者感觉,后V4.1-Flash的基础大模型架构,应该开始考虑内生的时空认知能力了。


https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf

 

前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →