模型索引
深度求索·DeepSeek V / R

DeepSeek-V2

以 Multi-head Latent Attention 与细粒度 MoE 降低训练和推理成本。

历史版本语言开放权重
模型编号016
发布日期
2024-05-06
组织
DeepSeek
家族
DeepSeek V / R
01

规格概览

仅展示已有公开资料的规格。

总参数
236B
激活参数
21B
架构
MoE
上下文
128K
输入模态
文本
开放权重
许可证
DeepSeek License
状态
历史版本
02

概览

概览

以 Multi-head Latent Attention 与细粒度 MoE 降低训练和推理成本。

为什么重要

DeepSeek-V2 证明高效稀疏架构可以在开放权重路线中形成成本与能力的双重竞争力。

03

架构与能力

注意力机制

MLA

主要能力

长上下文编码
04

发布历史

开放权重

DeepSeek-V2 发布模型权重与技术报告。

查看原文
05

相关模型

点击卡片查看相关模型。

06

来源