DeepSeek V4是什么?

2026-08-05 01:51 1 次浏览 AI 问答

DeepSeek V4是DeepSeek公司发布的大语言模型系列,其中V4-Flash正式版总参数2840亿、每个token激活130亿,主攻Coding与Agent能力,未包含原生多模态。该模型通过后训练优化显著提升代码生成与工具操作性能,在多项评测中接近头部模型。

直接回答

DeepSeek V4 是 DeepSeek 公司推出的通用大语言模型。根据公开信息,目前已知的版本是 DeepSeek V4-Flash 正式版,总参数为 2840 亿,每个 token 激活约 130 亿参数。该模型没有调整架构和参数规模,而是将更新重点放在后训练阶段,主要提升 Coding(代码生成)与 Agent(智能体)能力。与同期发布的某些竞品不同,DeepSeek V4 仍以文本输入为主,暂未加入原生多模态视觉能力。

核心特点

  • 参数规模适中:总参数 2840 亿,激活参数 130 亿,相比同期 2.8 万亿参数级模型更为轻量,推理成本更低。
  • 专注后训练优化:不修改架构与参数规模,通过后训练技术大幅提升 Coding 和 Agent 任务的表现。
  • 文本输入为主:目前仍为纯文本模型,未集成原生多模态视觉能力,视觉相关任务可通过外部工具(如 OCR、VLM)配合完成。
  • 评测表现突出:在 WebDev 等代码与工具操作榜单上得分接近 GLM-5.2、K3 等头部模型,证明了后训练路线的有效性。

主要用途或影响

  • 代码生成与多轮工具操作:在网页开发、软件操作等场景中能够自主完成长链任务,提升开发效率。
  • Agent 能力:支持通过 Agent 框架执行复杂指令,如自动登录、操作平台、检查结果等。
  • 影响行业技术路线:DeepSeek V4 证明了在不加入视觉、不扩大参数规模的情况下,仍可通过后训练提升核心任务能力,为其他模型厂商提供了另一种技术选择。

常见误区

  • 误区一:DeepSeek V4 是原生多模态模型。实际上,DeepSeek V4 目前仍以文本输入为主,未集成原生多模态视觉能力。其创始人曾表示“多模态最终还是要做”,但时机尚未成熟。
  • 误区二:参数越大越好。DeepSeek V4 总参数仅为竞品的十分之一左右,但通过后训练优化,在 Coding 和 Agent 评测中仍能接近头部水平,说明参数规模并非唯一决定因素。
  • 误区三:V4-Flash 是唯一版本。资料显示 DeepSeek 还曾发布过 V4-Pro 预览版,Flash 版本是后训练优化后的正式版,其性能大幅超过预览版。

使用或关注建议

  • 如果你是开发者:可关注 DeepSeek V4 在 Coding 和 Agent 场景中的表现,尤其是需要多轮交互和工具操作的任务。其较低的推理成本适合预算有限的部署。
  • 如果你需要多模态能力:建议结合外部视觉工具(如 OCR、VLM)使用,或等待 DeepSeek 未来的多模态版本。
  • 关注技术路线演变:DeepSeek 团队在原生多模态方面持谨慎态度,但创始人已明确表示“最终还是要做”,未来版本可能加入视觉能力。

信息来源:36氪,查看原始信息。本文由 AI ONLINE 基于公开资料整理,信息可能随时间变化,请以官方发布为准。