DeepSeek-V4-Flash 模型档案
DeepSeek-V4-Flash 是深度求索面向高吞吐、低成本和智能体任务推出的 V4 系列轻量型号,保留 1M 上下文、思考模式、工具调用与结构化输出能力。
- 厂商:杭州深度求索人工智能有限公司(DeepSeek)
- 版本:DeepSeek-V4-Flash(API 模型 ID:deepseek-v4-flash)
- 调用方式:DeepSeek API(OpenAI Chat Completions / Anthropic 兼容格式)或开放权重本地部署
- 上下文窗口:1M tokens
- 计费方式:按输入/输出 Token 计费,缓存命中输入单独计价
本文依据 DeepSeek 官方资料整理,资料与价格核对日期为 2026-07-20。模型价格、限额和接口行为可能调整,生产接入前请再次核对官方模型与价格页。
一句话介绍
DeepSeek-V4-Flash 采用 284B 总参数、13B 激活参数的 MoE 架构,以更低调用成本和更高并发提供接近 V4-Pro 的推理能力,适合在线助手、代码辅助、批量处理和简单智能体任务。
模型概览
| 项目 | 信息 |
|---|---|
| 模型名称 | DeepSeek-V4-Flash |
| 模型厂商 | DeepSeek(深度求索) |
| 当前版本 | DeepSeek-V4-Flash Preview |
| API 模型 ID | deepseek-v4-flash |
| 发布时间 | 2026-04-24 |
| 模型类型 | 文本生成、推理、代码、智能体、工具调用 |
| 模型架构 | MoE;284B 总参数,13B 激活参数 |
| 开源状态 | 开放权重,模型卡标注 MIT License |
| 上下文窗口 | 1M tokens |
| 最大输出长度 | 384K tokens |
| 思考模式 | 支持思考与非思考,默认开启思考 |
| 推理强度 | high / max |
| 原生多模态 | 官方 API 当前未列出图像、音频或视频输入能力 |
| 知识截止时间 | 官方未披露 |
DeepSeek 官方将 Flash 定位为快速、高效、经济的型号,并表示它在简单智能体任务上可达到接近 Pro 的表现。参数规模、上下文长度与开放权重信息来自官方 V4 发布说明及官方 Hugging Face 模型卡。
厂商信息
| 项目 | 信息 |
|---|---|
| 公司/组织 | DeepSeek / 杭州深度求索人工智能有限公司 |
| 所属国家或地区 | 中国 |
| 官方网站 | deepseek.com |
| 开发者平台 | platform.deepseek.com |
| API 文档 | api-docs.deepseek.com |
| 模型集合 | DeepSeek-V4 |
| API 支持邮箱 | api-service@deepseek.com |
厂商简介
DeepSeek 是专注于通用人工智能基础模型研究的中国团队。V4 系列继续采用开放权重路线,并重点优化百万 Token 长上下文、复杂推理、代码与智能体工作流。
版本信息
当前推荐版本
模型 ID: deepseek-v4-flash
该模型适合对响应速度、并发和成本更敏感的生产任务。官方 API 中思考模式默认开启;如果任务偏简单、追求低延迟,可以通过 thinking.type=disabled 使用非思考模式。
兼容模型名迁移
| 旧模型名 | 当前临时映射 | 停用时间 | 迁移目标 |
|---|---|---|---|
deepseek-chat |
V4-Flash 非思考模式 | 2026-07-24 23:59(北京时间) | deepseek-v4-flash + 关闭思考 |
deepseek-reasoner |
V4-Flash 思考模式 | 2026-07-24 23:59(北京时间) | deepseek-v4-flash + 开启思考 |
官方已公告旧模型名将在上述时间停用,新项目应直接使用 deepseek-v4-flash。详见更新日志。
版本选择建议
- 在线对话与摘要:优先 Flash,通常具有更好的速度与成本表现。
- 批量分类和抽取:优先 Flash,并配合 JSON Output。
- 简单智能体任务:优先 Flash,可使用工具调用与思考模式。
- 极复杂推理、知识密集或长链智能体:优先评估 V4-Pro。
- 本地部署:Flash 权重规模显著小于 Pro,但 284B 总参数仍意味着较高硬件门槛。
核心能力
| 能力 | 支持情况 | 说明 |
|---|---|---|
| 文本生成 | 支持 | 官方 API 当前主要提供文本能力 |
| 复杂推理 | 支持 | 思考模式默认开启,支持 high 与 max |
| 代码生成 | 支持 | V4 系列针对智能体编码进行优化 |
| JSON Output | 支持 | 适合结构化抽取与工作流连接 |
| Tool Calls | 支持 | 思考与非思考模式均可使用 |
| 对话前缀续写 | Beta | 需按官方 Beta 接口说明调用 |
| FIM 补全 | Beta | 仅非思考模式支持 |
| 流式输出 | 支持 | 使用 stream=true |
| 上下文缓存 | 支持 | API 默认启用磁盘上下文缓存 |
| 图像/音频/视频 | 未列出 | 不应假设具备原生多模态输入能力 |
调用信息
可用渠道
| 渠道 | 可用性 | 入口 | 备注 |
|---|---|---|---|
| DeepSeek 官方 API | 可用 | 开放平台 | 推荐的托管调用方式 |
| OpenAI 兼容格式 | 可用 | https://api.deepseek.com |
使用 Chat Completions 接口 |
| Anthropic 兼容格式 | 可用 | https://api.deepseek.com/anthropic |
可接入 Claude Code 等生态 |
| DeepSeek 网页端 | 可用 | chat.deepseek.com | 官方发布说明称对应 Instant Mode |
| 开放权重本地部署 | 可用 | Hugging Face 集合 | 需要自行评估硬件与推理框架 |
接口信息
| 项目 | 信息 |
|---|---|
| OpenAI 格式 Base URL | https://api.deepseek.com |
| Anthropic 格式 Base URL | https://api.deepseek.com/anthropic |
| Chat Completions | POST /chat/completions |
| 鉴权方式 | Bearer API Key |
| 模型 ID | deepseek-v4-flash |
| 流式输出 | 支持 |
| 默认思考模式 | 开启 |
| 官方 SDK | 可使用 OpenAI SDK或 Anthropic SDK |
环境变量
DEEPSEEK_API_KEY="your-api-key"
DEEPSEEK_BASE_URL="https://api.deepseek.com"
DEEPSEEK_MODEL="deepseek-v4-flash"
cURL 调用示例
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{"role": "system", "content": "你是一名严谨的技术助手。"},
{"role": "user", "content": "请用表格比较 Redis 与 Memcached。"}
],
"thinking": {"type": "enabled"},
"reasoning_effort": "high",
"stream": false
}'
Python 调用示例
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "system", "content": "你是一名严谨的技术助手。"},
{"role": "user", "content": "请给出一个 Flask 健康检查接口。"},
],
reasoning_effort="high",
extra_body={"thinking": {"type": "enabled"}},
)
print(response.choices[0].message.content)
思考模式注意事项
- 通过
thinking.type设置enabled或disabled。 reasoning_effort支持high和max。- 思考模式下
temperature、top_p、presence_penalty、frequency_penalty不生效。 - 思考模式配合工具调用时,后续请求必须完整回传当前轮的
reasoning_content,否则可能返回 400。
详细行为以官方思考模式文档为准。
价格与配额
价格核对日期:2026-07-20
| 计费项目 | 单价 | 计费单位 |
|---|---|---|
| 输入 Token(缓存命中) | 0.02 元 | 每百万 Token |
| 输入 Token(缓存未命中) | 1 元 | 每百万 Token |
| 输出 Token | 2 元 | 每百万 Token |
限流与配额
- 账户并发限制:2500。
- 超出并发限制:返回 HTTP 429。
- 提高并发:可向 DeepSeek 提交扩容申请。
user_id:可用于内容安全、KV Cache 和调度隔离;不要放入隐私信息。
模型优势
- API 价格低,缓存命中成本尤其低,适合高频调用。
- 每账户默认并发 2500,高于 V4-Pro,更适合在线和批处理服务。
- 支持 1M 上下文、思考模式、工具调用和 JSON Output。
- 官方称其推理能力接近 V4-Pro,简单智能体任务表现可与 Pro 相当。
- 提供开放权重,便于研究、私有化评估与二次部署。
已知限制
- 官方 API 当前以文本任务为主,未列出原生图像、音频或视频输入能力。
- 在知识密集、极复杂推理和长链智能体任务中,官方定位仍略弱于 V4-Pro。
- 思考模式下部分采样参数不生效,迁移现有调用代码时需检查行为差异。
- 模型输出仍可能出现事实错误,医疗、法律、金融等高风险场景必须人工复核。
- 虽然相对 Pro 更轻,但 284B 总参数的本地部署依然需要可观的计算和存储资源。
推荐使用场景
- 在线客服、知识问答和文本摘要。
- 代码补全、代码解释和常规开发辅助。
- 结构化抽取、分类和批量内容处理。
- 对成本与吞吐敏感的 RAG 应用。
- 简单至中等复杂度的工具调用与智能体工作流。
- Claude Code、OpenCode 等编码工具的子任务模型。
不推荐使用场景
- 依赖原生视觉、语音或视频理解的任务。
- 无人工复核的医疗、法律、金融决策。
- 对最强知识能力或最复杂智能体规划有硬性要求的任务。
- 未经容量评估直接进行本地全量权重部署。
与 DeepSeek-V4-Pro 对比
| 项目 | DeepSeek-V4-Flash | DeepSeek-V4-Pro |
|---|---|---|
| 总参数 / 激活参数 | 284B / 13B | 1.6T / 49B |
| 上下文窗口 | 1M | 1M |
| 最大输出 | 384K | 384K |
| 输入价(未命中缓存) | 1 元/百万 Token | 3 元/百万 Token |
| 输出价 | 2 元/百万 Token | 6 元/百万 Token |
| 默认并发 | 2500 | 500 |
| 核心定位 | 快速、经济、高吞吐 | 最强推理、知识和复杂智能体 |
安全、隐私与合规
| 项目 | 说明 |
|---|---|
| API 密钥 | 只通过服务端环境变量管理,不写入前端或仓库 |
| 用户隔离 | 可通过 user_id 隔离 KV Cache、调度和内容安全上下文 |
| 数据处理 | 应按 DeepSeek 开放平台条款和适用隐私政策单独评估 |
| 数据保留 | 公开 API 文档未给出统一的零保留承诺,企业接入前应向官方确认 |
| 高风险输出 | 仅作参考,重要结论需由专业人员复核 |
DeepSeek 的一般隐私政策说明,相关服务的数据可能在中国境内服务器处理和存储;但开发者下游系统中最终用户数据的处理规则需要结合开放平台条款单独确认。参见DeepSeek 隐私政策和开放平台服务条款。
迁移与兼容性
- 将
deepseek-chat替换为deepseek-v4-flash,并显式关闭思考模式。 - 将
deepseek-reasoner替换为deepseek-v4-flash,并显式开启思考模式。 - 使用 OpenAI SDK 时,
thinking通过extra_body传递。 - 如果从 Anthropic SDK 接入,Base URL 使用
https://api.deepseek.com/anthropic。 - 上线前验证思考内容回传、工具调用、超时、429 重试和成本统计。
结论
DeepSeek-V4-Flash 是 V4 系列中更适合大多数在线生产任务的默认选择。它以约六分之一的激活参数规模提供 1M 上下文和完整的推理、工具调用能力,同时 API 价格和并发显著优于 Pro。对于常规问答、代码辅助、批处理、RAG 和简单智能体,应优先从 Flash 开始评估;只有在知识密度、复杂推理或长链智能体能力成为瓶颈时,再切换到 V4-Pro。
官方资料
- DeepSeek-V4 发布说明
- 模型与价格
- 快速开始与 API 示例
- 思考模式
- 限速与隔离
- DeepSeek-V4 官方模型集合
- DeepSeek-V4 官方模型卡与技术报告入口
- DeepSeek 隐私政策
更新记录
| 日期 | 更新内容 | 编辑者 |
|---|---|---|
| 2026-07-20 | 根据 DeepSeek 官方文档创建模型档案 | 一六聊技术 |