02 / MODEL INDEX
AI 模型索引
浏览已收录模型的首次发布日期、所属组织与家族,以及架构、上下文和开放权重信息。
GLM-5 首个原生多模态 Flash 型号,320B 总参数、18B 激活参数,采用稀疏与线性混合注意力。
Qwen4 架构预览:125B 主模型加 51B N-gram embedding,每 token 激活 6B,并可扩展到 1M 上下文。
在 V4 Flash 上加入图像输入的实验 API 型号。
沿用 GLM-5.2 基座,仅通过扩大后训练提升复杂编码、长程任务与网络能力。
Qwen3.8 的 27B Dense 开放型号,兼顾本地部署、视觉、编码和工具使用。
当前 Gemini Flash 主力型号,强化软件工程、网页开发、多步骤 Agent 与设计稿还原。
V4-Pro 正式快照,强化生产环境 Agent,支持 low、high、max 推理强度与 Responses API。
在 Grok 4.5 基础上强化长程 Agent、复杂代码库与交互式视觉项目。
面向本地常驻 Agent 的 30B 开放模型,可在单张消费级 GPU 或 Mac、PC 上运行。
当前预览版全能视频型号,单次最长 30 秒并支持最多 20 个多模态参考素材。
Muse 当前主力模型,重点提升编码并配套推出多 Agent 编码工具 Muse Code。
Qwen3.8 旗舰,2.4T 总参数、95B 激活参数,覆盖文本、图像、视频与 1M 上下文。
在 V4-Flash-Preview 相同架构上重新后训练的正式 API 版本,重点提升 Agent 能力。
单次生成最长 30 秒,支持多轮延长、30 图/10 视频/10 音频参考和时间戳级编辑。
开放全模态生成系统,可输出最长 15 秒、最高 2K、24fps 的原生立体声视频。
Opus 新一代旗舰,采用 1M 默认上下文与自适应思考,面向长程 Agent、科研和企业工作。
当前默认版本,重点提升审美、图像质量、个性化理解并减少低质量结果。
为大规模自动化与子 Agent 设计的 3.5 系列低延迟规格。
相比 3.5 Flash 提高 token 效率与编码、Agent 规划能力,并减少输出冗长。
以 4.5K token 输入、10px 小字、多语言与复杂版面强化“可直接使用”的图像内容。
2.8T 参数开放 MoE,采用 KDA 与 Attention Residuals,支持原生视觉和 1M 上下文。
面向编码、Agent 和知识工作的高速旗舰,在 Grok Build 与 API 提供。
强化工具、计算机操作、编码和多模态理解,并以 1M 上下文开放 Meta Model API 预览。
面向专业设计的信息可视化、像素级交互编辑、真实质感和多语言生成旗舰。
可调用搜索与代码工具、自我迭代,并支持单图和多图参考的 Agent 化图片模型。
Muse 家族的视频生成预览,强调视觉保真、时间一致性与原生音频;尚未正式开放。
Hy3 正式版以真实产品反馈继续提升 Agent、编码和输出稳定性。
Sonnet 新一代模型,以 1M 默认上下文、自动思考和更强 Agent 能力缩小与 Opus 的差距。
Nano Banana 家族最快、成本最低的高吞吐图像型号。
Google 面向低成本视频生成和多轮对话式编辑的 Gemini 原生型号。
由 Sol、Terra、Luna 三个长期能力层组成的模型系列,覆盖旗舰、均衡与高性价比定位。
Seed 当前主线,强化长程通用 Agent、端到端编码和科学计算工作流。
把上下文扩展到 1M,并针对大型代码库、长文档和项目级 Agent 工作优化。
基于 Gemma 4 的实验性文本扩散模型,以块级并行生成探索更低延迟。
以保守安全配置通用发布的 Mythos 级模型,面向软件工程、研究与复杂知识工作。
Ray 当前型号,面向更完整的创意控制和 API 生产工作流。
面向笔记本的统一无编码器多模态型号,补齐 E4B 与 26B 之间的档位。
MiniMax 当前开放旗舰:1M 上下文、原生图像视频理解以及编码和计算机操作。
在 Opus 4.7 基础上改进 Agent 判断、工具效率、计算机操作和长会话协作。
Google 3.5 代首个公开模型,将前沿智能与低延迟行动定位合并到 Flash 层。
Gemini 3 系列的低延迟、高吞吐和低成本规格。
GPT-5.5 的日常快速层,改进准确性、简洁度与个性化上下文使用。
DeepSeek V4 的高能力预览型号,采用 1.6T 总参数、49B 激活参数的 MoE 与 1M 上下文。
V4 的高效率预览型号,284B 总参数、13B 激活参数,支持 1M 上下文。
腾讯重建训练基础设施后的首个 Hy3 预览,采用快慢思考融合与稀疏 MoE。
面向复杂知识工作、计算机操作、编码和科研的 1M 上下文前沿模型。
原生全模态理解、1M 上下文和 Agent 执行并重的 MiMo 当前通用型号。
MiMo-V2.5 的高强度 Agent 规格,强化长程推理、编码和复杂任务效率。
Qwen3.6 的 27B Dense 规格,面向本地部署与通用多模态 Agent。
面向 2K 生产素材、复杂排版、多语言文字和高保真编辑的当前旗舰。
K2.5 的后续开放模型,全面提升长程编码、通用 Agent、视觉理解与 Agent Swarm。
重点提升高难软件工程、长程一致性、高分辨率视觉与自我验证。
Qwen3.6 的高效率 MoE 规格,以 3B 激活参数覆盖多模态、编码与工具任务。
提供原生 2K HD,标准生成约 4—5 倍提速,并改善文字和细节保持。
Muse 家族首个原生多模态推理模型,支持工具、视觉思维链和多 Agent 编排。
面向长程任务的 GLM-5 更新,可在单次任务中持续自主执行数小时。
将有声文生、首尾帧、视频续写、多参考和指令编辑整合到 1080p 云端系列。
Gemma 4 的高质量 Dense 旗舰,面向本地推理、编码和 Agent 工作流。
每步仅激活 3.8B 参数的 Gemma 4 MoE,强调本地速度与智能密度。
万相图像型号,覆盖组图、多图参考、交互编辑和最高 4K 输出。
强化 Agent 团队、自我演进和端到端软件生产力。
万亿参数、42B 激活的 1M 上下文 Agent 旗舰。
把文本、视觉和语音感知与工具、GUI 操作统一到同一 Agent 基座。
面向编码和子 Agent 的高速小模型,支持文本、图像、工具与 400K 上下文。
GPT-5.4 系列最小规格,面向高吞吐抽取、排序和简单编码子任务。
把 GPT-5.3-Codex 的编码能力与通用推理、工具和专业文档工作合并到统一前沿模型。
面向日常对话的 GPT-5.3 更新,重点减少无必要拒绝、提高搜索准确性和表达流畅度。
以 Flash 价格和速度提供 0.5K—4K 生成、思考和图像搜索落地。
Gemini 3 Pro 的后续预览版本,并提供更偏向自定义工具的独立端点。
Sonnet 4.5 的全面升级,覆盖编码、计算机操作、长上下文、Agent 规划与设计。
Qwen3.5 首发旗舰,将 Qwen3-Next 的混合架构扩展为原生多模态 Agent 模型。
系统提升多模态理解、基础推理与真实生产环境的 Agent 表现。
把深度思考和实时搜索带入轻量图像生成与编辑。
扩大到 744B 总参数并引入 DSA,定位从“写代码”转向复杂系统工程。
为实时交互式编码设计的小型高速 Codex 研究预览。
面向编码、工具与办公生产力的高效率更新。
统一文本、图片、音频、视频参考和编辑,支持 15 秒多镜头双声道输出。
统一生成与编辑,支持 1K token 复杂指令、原生 2K 和更真实的细节。
将编码 Agent 扩展到研究、工具使用和完整计算机任务的 Codex 模型。
首次为 Opus 提供 1M 上下文测试,并强化长程 Agent、代码审查和自适应思考。
原生多模态 3.0 系列把图像、视频、音频的理解、生成和编辑整合为最长 15 秒叙事工作流。
在 K2 上继续预训练的原生多模态模型,加入视觉编码和最多 100 个子 Agent 的 Agent Swarm。
把 Ray3 提升到原生 1080p,并显著降低延迟和成本。
面向消费级 GPU 的亚秒级生成与编辑型号。
继续提升真实编码任务、工具调用和 Agent 稳定性。
GLM-4.5 后续开放模型,继续提升编码、推理和 Agent 任务。
基于 GPT-5.2 优化的长程软件工程模型,强化大型代码变更、Windows 与上下文压缩。
面向搜索、代码、GUI 与复杂工作流的通用 Agent 模型。
Gemini 3 的低延迟预览型号,强化视觉空间推理与 Agent 编码。
以混合滑窗注意力和 MTP 提升长上下文编码与 Agent 推理速度。
重点提升局部编辑、细节保持、文字表现并把生成速度提高约四倍。
加入联合声画生成、多语言对白、镜头控制与更完整的叙事表达。
面向专业知识工作与长程 Agent 的 GPT-5 系列升级,提供 Instant、Thinking 与 Pro 层级。
统一非思考与思考模式的通用模型,加入稀疏注意力并面向日常 Agent 任务。
V3.2 的高推理版本,面向数学、竞赛编程和更长思考任务。
面向高保真电影感、复杂时序指令和专业 HDR 输出的 Runway 当前旗舰。
在可灵 O1 与 2.6 系列中统一视频生成、参考和编辑,并加入原生音频。
扩展到多参考图编辑、精确色彩与更强真实感的第二代视觉家族。
引入 effort 控制并提升编码、Agent、计算机操作和多 Agent 协调。
基于 Gemini 3 Pro 的专业图像型号,强化推理、真实知识、多语言文字与 4K 控制。
面向真实工具调用与深度研究的 2M 上下文快速 Agent 模型,提供思考和非思考版本。
Gemini 3 首个 Pro 预览型号,面向复杂推理、编码、工具和多模态任务。
以大规模强化学习改善真实对话中的风格、意图理解、协作感和事实准确性。
面向 API 的自适应推理更新,在简单任务上减少思考延迟,并加入 apply_patch 与 shell 工具。
在 K2 基础上训练的 Thinking Agent,原生支持边思考边调用工具。
提升肢体动作、微表情、风格化与运动指令响应,并加入低成本 Fast 版。
把 MiniMax 主线转向高效编码和 Agent 执行。
低延迟 Haiku 型号,以更低成本提供接近早期 Sonnet 4 的编码与计算机操作能力。
强化叙事控制、参考一致性和编辑,并扩展到 1080p、4K 与竖屏输出。
提升物理一致性、可控性和多镜头状态保持,并原生生成对白与音效;产品于 2026-04-26 停止服务。
强化长程编码、计算机操作与复杂 Agent,并同步推出 Claude Agent SDK。
80B 总参数、13B 激活的原生多模态 MoE 图像生成模型。
超过 1T 参数的 Qwen3 旗舰,面向编码、Agent 与百万上下文专业任务。
统一思考与非思考模式的高效率 Grok 4 变体,支持 2M 上下文与实时搜索。
加入视觉推理、自我评估、原生 HDR EXR 和草稿到 4K 的创作流程。
以 80B 总参数、3B 激活参数探索混合线性注意力和超稀疏 MoE 的架构预览。
统一文生图和通用编辑,以视觉语言模型注入世界知识,并支持最高 4K。
把 Gemini 2.5 Flash 的知识和多轮对话用于快速图像生成与编辑。
GPT-5 将快速回答、深度推理与自动路由整合为统一系统,并在 API 提供主模型、mini 与 nano 三种规格。
GPT-5 的低成本规格,面向需要兼顾推理质量、吞吐与价格的任务。
GPT-5 最小规格,面向分类、抽取、排序和轻量子任务。
20B MMDiT 图像基础模型,重点解决中英文复杂文字渲染和精确编辑。
355B 总参数、32B 激活的混合推理 MoE,统一推理、编码和 Agent 能力。
把双专家 MoE 引入视频扩散,并开放 720p 文生、图生、语音驱动和角色动画型号。
1T 总参数、32B 激活的开放 MoE,重点面向 Agent 工具调用与编码。
在 Grok 3 Reasoning 基础上大幅扩大强化学习,并原生集成工具、网页与 X 搜索。
以 MatFormer 和 Per-Layer Embeddings 把全模态理解压缩到移动设备。
引入自适应思考,将文本与视觉能力统一到 230B MoE 基座。
从单张图片生成 5 秒视频,可延长至 21 秒并支持首尾帧、循环和高低运动模式。
以原生 1080p、复杂动作和物理表现推进海螺视频主线。
以线性和 Softmax 混合注意力实现 1M 上下文的开放推理模型。
以原生多镜头叙事、1080p 和复杂动作稳定性建立 Seedance 主线。
统一生成与上下文编辑,支持多轮修改、角色一致性和局部控制。
Claude 4 家族旗舰,重点提升长程编码、复杂 Agent 与持续数小时的任务执行。
Claude 4 的均衡能力层,改进编码、推理、指令遵循和并行工具调用。
支持最高 2K、多种画幅,并显著改进细节、拼写和排版。
首次为 Veo 加入原生对白、环境声和音效生成。
小米首个开放推理模型,以 7B 规模探索预训练到强化学习的完整路线。
Qwen3 旗舰 MoE,将 thinking 与 non-thinking 模式放入同一开放模型。
把 GPT-4o 原生图像能力带到 API,兼顾知识、风格遵循与文字生成。
17B 激活参数、16 专家的多模态 MoE,支持最长 10M 上下文。
400B 总参数、128 专家的 Llama 4 高能力开放型号。
加入默认个性化、Omni Reference、十倍速草稿模式和对话式创作。
强化跨场景主体、地点与风格一致性,并提供更直接的镜头控制。
Google 将“thinking”直接内置到通用 Gemini 代际,并重点提升复杂推理与编码。
加入图像输入、128K 上下文和 140 多种语言支持。
开放 1.3B、14B 文生和图生视频权重,并覆盖 VACE 通用视频编辑。
在同一模型内提供即时回答和可控的 extended thinking,并同步发布 Claude Code。
xAI 的推理 Agent 代际,以 Think 与 DeepSearch 模式扩展复杂任务能力。
以低延迟多模态模型为基础,引入原生工具调用和 Flash Thinking 实验路线。
以大规模强化学习塑造推理能力,并开放模型权重与蒸馏版本。
Moonshot 的多模态推理模型研究,重点探索长上下文强化学习与推理扩展。
Luma 第二代大规模视频模型,强化自然动作、物理与镜头表达。
671B 总参数、37B 激活参数的 MoE 模型,继续扩大高效训练与开放发布路线。
以更强物理、摄影语言和最高 4K 研究输出推进 Google 视频主线。
Sora 首个正式产品版本,支持最长 20 秒、1080p 以及扩展、混合和故事板。
用 70B 规模接近 Llama 3.1 405B 的指令能力,显著降低部署成本。
腾讯首个大规模开放 MoE,389B 总参数、52B 激活参数。
以 8.1B Large、Turbo 和 2.5B Medium 形成可定制的开放图像梯度。
加入 11B、90B 视觉型号,并以 1B、3B 小模型扩展端侧部署。
Google 高质量文生图主线的重要一代,提升细节、光照和提示遵循。
BFL 首代流匹配图像家族,覆盖开放开发版、快速版和托管专业版。
Llama 首个 405B 开放旗舰,并把全系列上下文扩展到 128K。
以 9B、27B 规格提升推理与单加速器部署能力。
引入 MMDiT,并以 2B 参数面向消费级显卡。
Qwen2 最大的 Dense 规格,统一采用 GQA,并扩展到 27 种额外语言。
原生处理文本、视觉和音频的“omni”模型,显著降低多模态交互延迟。
以 Multi-head Latent Attention 与细粒度 MoE 降低训练和推理成本。
以 8B 和 70B 两种规格开启 Meta 新一代开放模型主线。
Claude 3 家族的旗舰型号,将视觉输入与 200K 长上下文纳入统一模型。
Google 首代轻量开放模型,提供 2B 和 7B 规格。
以 MoE 架构把可用上下文扩展到 1M token,并保持跨模态检索能力。
显著提升长提示理解、画面一致性、知识和图像参考能力。
Gemini 首代旗舰,从训练起即面向文本、图像、音频与视频的原生多模态。
Qwen 开放模型路线的起点,重点覆盖中英双语、多语言与工具使用。
以基础模型加精炼器的两阶段管线把开放生成提升到原生 1024 分辨率。
显著扩展到 100K 上下文,并通过 API 与 claude.ai 面向更广泛用户开放。
面向复杂专业任务的大型多模态模型;核心规模和训练细节未公开。
Anthropic 首个面向公众的 Claude 模型,以 Constitutional AI 训练路线为核心。
将高质量文生图权重带到本地 GPU,催生广泛的社区工具与微调生态。
175B 参数自回归模型,系统展示了无需微调的少样本与上下文学习。
将无监督语言建模展示为可迁移的通用任务学习,并采用分阶段权重发布。