DeepSeek刚刚发布了全新架构模型DeepSeek-V4.1-Flash。
这是DeepSeek新架构家族中体量最小的一款。
自带原生视觉理解能力。
推理速度更快,吞吐量更高,并且能进一步扩展到更大规模的模型上。
架构大变样,显存占用暴降
新模型总参数量为552B,采用MoE结构。
它使用了全新的因果编码器解码器架构。
处理输入时,激活参数
只有8B。
生成输出时,激活参数也只有16B。
配合全新的预训练方法和更大规模的强化学习后训练,它的各项基准测试成绩,直接超过了上一代旗舰模型DeepSeek-V4-Pro。
在KV缓存占用上,提升同样明显。
相比上一代模型:
HBM显存占用降到四分之一。
SSD存储占用降到八分之一。
由于缓存命中费用在Agent使用成本中占比极高,这项压缩直接大幅拉低了实际开销。
老旗舰连夜退役,API直接降价
目前V4.1-Flash已经在DeepSeek API正式上线,原生支持多模态,调用名称为deepseek-flash。
由于新模型在性能、成本、速度和总运行时间上全面超越老旗舰,DeepSeek决定逐步淘汰V4-Pro:
V4-Flash和V4-Flash-Vision-Exp正式退役,旧接口会临时切到V4.1-Flash。
2026年9月14日04:00 UTC开始,所有deepseek-v4-pro的请求,都会自动切到V4.1-Flash,并且直接按V4.1-Flash的更低费率扣费,直到V4.1-Pro正式上线。
官方合作伙伴WorkBuddy_AI(包含Codebuddy)以及opencode,现在已经全面支持V4.1-Flash。
更高效的架构也带来了更低的API价格。
平台继续保留高峰期和低谷期定价策略。
低谷期的调用价格只要高峰期的50%。
全新API价格将在2026年9月10日04:00 UTC正式生效。
开源与部署
DeepSeek继续拥抱开源,模型权重和技术报告均已公开。
团队表示将与开源社区合作推进推理支持,并探索更多部署方案。
对于拥有2000张GPU和存储集群的大规模部署需求,官方也开放了对接渠道。
模型地址:
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
论文地址:
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
薛定谔的梁圣再次回归,哈哈哈😂
--end--
最后记得⭐️我,每天都在更新:如果觉得文章还不错的话可以点赞转发推荐评论
/...@作者:你说的完全正确(YAR师)