以 Multi-head Latent Attention 与细粒度 MoE 降低训练和推理成本。
仅展示已有公开资料的规格。
DeepSeek-V2 证明高效稀疏架构可以在开放权重路线中形成成本与能力的双重竞争力。
DeepSeek-V2 发布模型权重与技术报告。
点击卡片查看相关模型。