返回时间轴
震后 发生于 2026.06 更新于 2026.08.21

从 R1 到 V4:震后的半年迭代

当百万上下文成为常规能力

V4 不只是参数变大,而是让 1M 上下文从 demo 变为可部署的常规能力,Pro 1.6T 与 Flash 284B 双轨并行。

#V4#长上下文#架构

V4 是什么

2026-06-24 发布:V4-Pro 1.6T 参数(49B 激活)、V4-Flash 284B(13B 激活),均支持 1M token。

预训练 32T+ tokens,经历完整后训练与领域专家 On-Policy Distillation。

核心升级

混合注意力 CSA + HCA:对 KV 按序列维度极致压缩,Flash 的 KV cache 仅为 V3.2 的 7%。

mHC 流形约束超连接:将残差混合矩阵投影到 Birkhoff 多面体,保证双随机、信号均值守恒,n=4 时仅 +6.7% 开销。

Muon 优化器替代 Adam,加速收敛与稳定性。

效率对比

1M 上下文:V4-Pro 单 token FLOPs 27% / KV 10% vs V3.2;Flash 10% / 7%。

基础设施:MoE 融合核、TileLang DSL、ZeRO 混合、KV 异构存储与磁盘卸载,让百万上下文可上生产。

性能

V4-Pro-Max 在知识、推理、Agent、长上下文基准接近或超越 Gemini-3.1-Pro、GPT-5.4。

标志着开源模型首次在百万上下文上定义 SOTA。

来源
  • · DeepSeek-V4 2026-06-24
  • · mHC 2025-12-31
  • · DeepSeek-V3.2 2025-12-02

内容基于公开新闻与论文整理,仅为知识科普,不构成投资建议。

发生时间 2026.06 内容更新于 2026.08.21 · 持续迭代中