返回时间轴
震前 发生于 2024.12 更新于 2026.08.21

V3 前夜:557万美元的预训练

V3 以 557万美元成本对标 GPT-4 级别能力,论文里早已埋下 R1 的伏笔。

#V3#成本

成本是刻意设计的

V3 论文公开:278.8M token 训练,成本约 557.6万美元。

同级别 GPT-4 估算成本超1亿美元,相差近20倍。

怎么做到的

1. FP8 混合精度训练,大幅降低显存与通信。

2. MLA+MoE 架构红利,激活参数仅37B。

3. 高质量数据配比,而非堆量。

为 R1 铺路

V3 是基座,R1 是在 V3 之上用 GRPO 做推理强化。

没有 V3 的低成本基座,就没有 R1 的低成本推理。

来源
  • · DeepSeek-V3 Technical Report

内容基于公开新闻与论文整理,仅为知识科普,不构成投资建议。

发生时间 2024.12 内容更新于 2026.08.21 · 持续迭代中