返回时间轴
震后 发生于 2026.06 更新于 2026.08.21
从 R1 到 V4:震后的半年迭代
当百万上下文成为常规能力
V4 不只是参数变大,而是让 1M 上下文从 demo 变为可部署的常规能力,Pro 1.6T 与 Flash 284B 双轨并行。
#V4#长上下文#架构
V4 是什么
2026-06-24 发布:V4-Pro 1.6T 参数(49B 激活)、V4-Flash 284B(13B 激活),均支持 1M token。
预训练 32T+ tokens,经历完整后训练与领域专家 On-Policy Distillation。
核心升级
混合注意力 CSA + HCA:对 KV 按序列维度极致压缩,Flash 的 KV cache 仅为 V3.2 的 7%。
mHC 流形约束超连接:将残差混合矩阵投影到 Birkhoff 多面体,保证双随机、信号均值守恒,n=4 时仅 +6.7% 开销。
Muon 优化器替代 Adam,加速收敛与稳定性。
效率对比
1M 上下文:V4-Pro 单 token FLOPs 27% / KV 10% vs V3.2;Flash 10% / 7%。
基础设施:MoE 融合核、TileLang DSL、ZeRO 混合、KV 异构存储与磁盘卸载,让百万上下文可上生产。
性能
V4-Pro-Max 在知识、推理、Agent、长上下文基准接近或超越 Gemini-3.1-Pro、GPT-5.4。
标志着开源模型首次在百万上下文上定义 SOTA。
来源
- · DeepSeek-V4 2026-06-24
- · mHC 2025-12-31
- · DeepSeek-V3.2 2025-12-02
内容基于公开新闻与论文整理,仅为知识科普,不构成投资建议。
发生时间 2026.06 内容更新于 2026.08.21 · 持续迭代中