阅读,与值得关注的内容Readance

DeepSeek突发全新架构V4.1-Flash干翻一众旗舰,HBM占用暴降到1/4,SSD降到1/8


↑阅读之前记得关注+星标⭐️,😄,每天才能第一时间接收到更新


 

DeepSeek刚刚发布了全新架构模型DeepSeek-V4.1-Flash。

这是DeepSeek新架构家族中体量最小的一款。

自带原生视觉理解能力。

推理速度更快,吞吐量更高,并且能进一步扩展到更大规模的模型上。

架构大变样,显存占用暴降

新模型总参数量为552B,采用MoE结构。

它使用了全新的因果编码器解码器架构。

处理输入时,激活参数

只有8B。

生成输出时,激活参数也只有16B。

配合全新的预训练方法和更大规模的强化学习后训练,它的各项基准测试成绩,直接超过了上一代旗舰模型DeepSeek-V4-Pro。

在KV缓存占用上,提升同样明显。

相比上一代模型:

HBM显存占用降到四分之一。

SSD存储占用降到八分之一。

由于缓存命中费用在Agent使用成本中占比极高,这项压缩直接大幅拉低了实际开销。

老旗舰连夜退役,API直接降价

目前V4.1-Flash已经在DeepSeek API正式上线,原生支持多模态,调用名称为deepseek-flash。

由于新模型在性能、成本、速度和总运行时间上全面超越老旗舰,DeepSeek决定逐步淘汰V4-Pro:

V4-Flash和V4-Flash-Vision-Exp正式退役,旧接口会临时切到V4.1-Flash。

2026年9月14日04:00 UTC开始,所有deepseek-v4-pro的请求,都会自动切到V4.1-Flash,并且直接按V4.1-Flash的更低费率扣费,直到V4.1-Pro正式上线。

官方合作伙伴WorkBuddy_AI(包含Codebuddy)以及opencode,现在已经全面支持V4.1-Flash。

更高效的架构也带来了更低的API价格。

平台继续保留高峰期和低谷期定价策略。

低谷期的调用价格只要高峰期的50%。

全新API价格将在2026年9月10日04:00 UTC正式生效。

开源与部署

DeepSeek继续拥抱开源,模型权重和技术报告均已公开。

团队表示将与开源社区合作推进推理支持,并探索更多部署方案。

对于拥有2000张GPU和存储集群的大规模部署需求,官方也开放了对接渠道。

模型地址:

https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash

论文地址:

https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf

 

薛定谔的梁圣再次回归,哈哈哈😂



--end--


最后记得⭐️我,每天都在更新:如果觉得文章还不错的话可以点赞转发推荐评论

/...@作者:你说的完全正确(YAR师)


前往微信阅读全文

内容来自公众号,可前往微信查看原文。

查看作者的更多文章 →