DeepSeek V4-Flash-Vision-Exp深度解析:开源多模态Agent的新里程碑
一、引言:当DeepSeek终于"睁开眼睛"
2026年8月21日下午,DeepSeek官方API文档悄然出现了一个新模型名称:deepseek-v4-flash-vision-exp。没有盛大的发布会,没有万字技术报告——但这一行模型名称的背后,意味着DeepSeek V4系列首次直接支持图片输入,正式从纯文本迈入多模态时代。
如果说一周前(8月13日)DeepSeek开源Agent Harness是"给AI装上了手脚",那么V4-Flash-Vision-Exp的发布就是"给AI装上了眼睛"。这两个事件在时间上的紧密衔接并非巧合——它们共同指向一个更宏大的目标:构建一套完整的开源多模态Agent基础设施。
在此之前,DeepSeek Harness的GitHub讨论区里,“怎么让DeepSeek看图"已经成为一个高频问题。开发者上传图片时,Harness直接返回MODEL_DOES_NOT_SUPPORT_IMAGES,社区不得不自行开发"视觉桥接"插件(如dsh-deepseek-vision),先借助Qwen-VL等模型理解图片,再将文本描述传给DeepSeek。这种略显尴尬的"借眼"局面,终于在V4-Flash-Vision-Exp上线后画上句号。
二、DeepSeek V4系列演进路线:从纯文本到多模态
2.1 V4系列模型全景回顾
DeepSeek V4系列于2026年4月24日正式发布,采用双旗舰架构:
┌─────────────────────────────────────────────────────────────┐
│ DeepSeek V4 家族架构图 │
├─────────────────────────────────────────────────────────────┤
│ │
│ V4-Pro (旗舰推理) V4-Flash (高效推理) │
│ ┌─────────────────┐ ┌─────────────────┐ │
│ │ 总参数: 1.6T │ │ 总参数: 284B │ │
│ │ 激活参数: 49B │ │ 激活参数: 13B │ │
│ │ 训练数据: 33T │ │ 训练数据: 32T │ │
│ │ 上下文: 1M │ │ 上下文: 1M │ │
│ └─────────────────┘ └─────────────────┘ │
│ │ │ │
│ └─────────┬───────────────┘ │
│ │ │
│ ┌──────────▼──────────┐ │
│ │ 共同架构基础 │ │
│ │ • MoE + 混合注意力 │ │
│ │ • CSA + HCA 双重压缩 │ │
│ │ • mHC 流形约束超连接 │ │
│ │ • mxFP4 训练精度 │ │
│ │ • 三档推理强度 │ │
│ └─────────────────────┘ │
│ │
│ 2026-08-21: V4-Flash-Vision-Exp (多模态实验版) │
│ ┌─────────────────────┐ │
│ │ 文本能力 ≈ V4-Flash │ │
│ │ + 原生图片输入 │ │
│ │ + 1M上下文 / 384K输出│ │
│ │ + 多模态Agent能力 │ │
│ └─────────────────────┘ │
└─────────────────────────────────────────────────────────────┘
V4-Pro:总参数1.6万亿(1.6T),每Token激活49B参数,定位旗舰推理。在Codeforces竞赛评级达到3206分(人类第23名),SWE-bench Verified达81%,代表了开源模型推理能力的最高水平。
V4-Flash:总参数284B,每Token仅激活13B参数,定位高吞吐、低成本。在Agent任务上表现出色,Terminal Bench 2.1达82.7分,是性价比最高的开源Agent模型之一。
两者均为纯文本模型,支持1M上下文窗口,采用MoE + 混合注意力机制(CSA压缩稀疏注意力 + HCA重度压缩注意力),并引入了流形约束超连接(mHC)和mxFP4训练精度等创新。
2.2 从V4-Flash到Vision-Exp:关键演进脉络
时间线:DeepSeek V4系列关键里程碑
2026-04-24 ── V4预览版发布 (V4-Pro + V4-Flash,纯文本)
│
│ • MIT协议全量开源
│ • 1M上下文,MoE架构
│ • 无多模态能力
▼
2026-07-31 ── V4-Flash正式版公测
│
│ • Agent能力大幅增强
│ • 原生支持Responses API
│ • 适配Codex
▼
2026-08-13 ── V4-Pro GA版 + DeepSeek Harness开源
│
│ • 开源Agent Harness (v0.1.0-rc.6)
│ • 全插件化架构(Cordis)
│ • 但模型仍不支持图片输入
▼
2026-08-14~20 ── Harness rc.7/rc.8更新
│
│ • 增强多模态支持度
│ • 模型适配器支持原生图片请求
│ • 社区自制"视觉桥接"插件涌现
▼
2026-08-21 ── V4-Flash-Vision-Exp上线 🎯
│
│ • 首个原生视觉模型
│ • Files API同步上线
│ • Harness v0.1.1开箱即用支持
│ • 多模态Agent能力接近Opus-4.8
2.3 为什么是V4-Flash而非V4-Pro承载视觉能力?
这是一个值得关注的产品决策。Vision Exp被放在了V4-Flash产品线中,而非V4-Pro。这意味着DeepSeek现阶段优先将视觉能力接入更小、更快、更便宜的模型。
V4-Flash本身只有284B总参数、13B激活参数,定位就是高吞吐、低成本。如果Vision版本延续这一定位,它瞄准的很可能不是单纯的图片聊天,而是大量发生在Agent里的视觉任务——读网页截图、识别报错界面、分析图表、查看软件UI、读取设计稿,再根据图片继续操作电脑或修改代码。这些任务对"单次图片理解达到最强"未必有极端要求,却非常在意速度、价格以及能否连续运行。
三、V4-Flash-Vision-Exp架构深度分析
3.1 架构推测:视觉前端 + 文本推理的组合方案
虽然DeepSeek尚未公布Vision Exp的完整技术报告,但结合现有信息可以做出合理推断:
┌─────────────────────────────────────────────────────────────────┐
│ V4-Flash-Vision-Exp 推测架构图 │
│ │
│ 用户输入 │
│ ┌──────────────┐ │
│ │ 文本 + 图片 │ │
│ └──────┬───────┘ │
│ │ │
│ ▼ │
│ ┌──────────────────┐ │
│ │ 视觉编码前端 │ ← 新增模块 (Vision Encoder) │
│ │ ┌──────────────┐ │ │
│ │ │ 图片解析 │ │ • JPEG/PNG/GIF/WebP │
│ │ │ 尺寸归一化 │ │ • 三种细节模式: low/original/auto │
│ │ │ Token折算 │ │ • 单张封顶384 Tokens │
│ │ └──────┬───────┘ │ │
│ └─────────┼─────────┘ │
│ │ │
│ ▼ │
│ ┌────────────────────────────────────┐ │
│ │ V4-Flash 核心推理引擎 (文本) │ ← 保持不变的文本能力 │
│ │ ┌──────────┐ ┌──────────┐ │ │
│ │ │ CSA注意力 │ │ HCA注意力 │ │ │
│ │ │ 压缩稀疏 │ │ 重度压缩 │ │ │
│ │ │ 注意力 │ │ 注意力 │ │ │
│ │ └──────────┘ └──────────┘ │ │
│ │ ┌────────────────────────────┐ │ │
│ │ │ MoE专家层 (284B总/13B激活) │ │ │
│ │ │ 1 shared + 256 routed │ │ │
│ │ │ 每Token激活6个Expert │ │ │
│ │ └────────────────────────────┘ │ │
│ └────────────────────────────────────┘ │
│ │ │
│ ▼ │
│ ┌──────────────────┐ │
│ │ 输出 (文本/JSON/ │ │
│ │ Tool Calls/ │ │
│ │ Responses API) │ │
│ └──────────────────┘ │
│ │
│ ⚡ 关键特征: │
│ • 视觉编码Token与文本Token统一计费 │
│ • 单张图片最多折算384 Tokens │
│ • 价格与V4-Flash完全一致,无视觉附加费 │
│ • 不支持视频输入 │
└─────────────────────────────────────────────────────────────────┘
关键推断:Vision Exp可能并非端到端统一训练的原生多模态模型,而是将视觉编码模块(Vision Encoder)接入V4-Flash文本推理引擎的前端。图片经过视觉编码器转换为Token序列后,与文本Token拼接,送入V4-Flash核心引擎进行统一推理。这种架构与Gemini、GPT系列更强调统一多模态预训练的路线存在区别,但具备工程实现快、成本低、不牺牲文本能力的优势。
3.2 核心能力矩阵
┌─────────────────────────────────────────────────────────────────┐
│ V4-Flash-Vision-Exp 能力全景 │
├───────────────┬─────────────────────────────────────────────────┤
│ 能力维度 │ 具体指标 │
├───────────────┼─────────────────────────────────────────────────┤
│ 上下文窗口 │ 1M Tokens (100万) │
│ 最大输出长度 │ 384K Tokens │
│ 图片格式 │ JPEG / PNG / GIF / WebP │
│ 图片上限 │ 单次请求最多600张图片 │
│ 图片分辨率 │ 最长边支持8192像素 │
│ 单文件大小 │ 64 MiB (Files API) / 32 MiB (内联) │
│ 图片细节模式 │ low(512×512) / original(保留原图) / auto(等同原图)│
│ 单张Token上限 │ 384 Tokens │
│ API格式 │ Chat Completions / Messages / Responses │
│ │ Anthropic API / 对话前缀续写 │
│ 功能支持 │ JSON Output / Tool Calls / Function Calling │
│ 图片传入方式 │ Base64内联 / 外部URL / Files API (file_id) │
│ 推理强度控制 │ low / high / max 三档 │
└───────────────┴─────────────────────────────────────────────────┘
3.3 Benchmark表现分析
DeepSeek官方公布了11项基准测试结果(使用DeepSeek Harness极简模式,max档,temperature=1.0,top-p=0.95):
┌──────────────────────────┬──────────┬──────────┬──────────┐
│ 基准测试 │ Vision-Exp│ V4-Flash │Opus-4.8 │
├──────────────────────────┼──────────┼──────────┼──────────┤
│ Terminal Bench 2.1 │ 83.9 │ 82.7 │ 85.0 │
│ NL2Repo │ 57.7 │ 54.2 │ 69.7 │
│ DeepSWE │ 59.3 │ 54.4 │ 58.0 │
│ DSBench-Hard │ 63.6 │ 59.6 │ 71.7 │
│ AutomationBench (Public) │ 25.7 │ 25.1 │ 27.2 │
│ ApexBench (Pass@1) │ 36.5 │ 26.2* │ 39.4 │
│ Agents' Last Exam │ 27.3 │ 25.2* │ 25.7 │
│ Chartography │ 64.3 │ — │ 65.0 │
│ ZeroBench (Pass@5) │ 35.0 │ — │ 34.0 │
│ Toolathlon-Verified │ 75.9 │ 70.3 │ 76.2 │
│ Cybergym │ 75.3 │ 76.7 │ — │
└──────────────────────────┴──────────┴──────────┴──────────┘
* V4-Flash为纯文本模型,在ApexBench和Agents' Last Exam中忽略多模态元素
关键解读:
文本能力持平:在纯文本Agent任务上,Vision Exp与V4-Flash正式版基本持平,部分指标甚至略优(如Toolathlon-Verified提升5.6分,DeepSWE提升4.9分,DSBench-Hard提升4.0分),说明加入视觉能力并未"拖累"文本推理。
多模态Agent大幅跃升:在需要视觉理解的ApexBench(界面操作)上,Vision Exp的36.5分相比V4-Flash的26.2分提升近40%,已接近Opus-4.8的39.4分。
与Opus-4.8的差距:在11项基准中,Vision Exp在3项上超越Opus-4.8(DeepSWE +1.3、Agents’ Last Exam +1.6、ZeroBench +1.0),其余8项落后,但差距多在2分以内。最大的差距在NL2Repo(12分)和DSBench-Hard(8.1分)——这两项都是仓库级代码任务,说明在复杂编程场景中仍有提升空间。
需注意:以上均为官方自测,第三方复测(如Artificial Analysis、CLUE、Arena等)尚未发布,建议保持审慎态度。
四、多模态Agent能力详解
4.1 从"听描述"到"亲眼看”:Agent能力的质变
V4-Flash-Vision-Exp最核心的价值,不在于"看图说话"的图像识别能力,而在于将视觉感知直接嵌入Agent工作流。这意味着:
传统纯文本Agent工作流:
用户描述 → 文本理解 → 推理规划 → 工具调用 → 执行
多模态Agent工作流 (Vision Exp):
截图/图片 → 视觉理解 → 文本理解 → 推理规划 → 工具调用 → 执行
↑ │
└──────────────── 循环反馈 ────────────────────────────┘
典型多模态Agent场景:
| 场景 | 之前(纯文本) | 现在(Vision Exp) |
|---|---|---|
| Web自动化测试 | 需手动提取DOM元素文本描述 | 直接截图,模型理解UI布局并操作 |
| 报错诊断 | 用户需手动复制错误信息 | 直接截图报错界面,模型自动识别 |
| 数据分析 | 需要结构化数据输入 | 直接读取图表、截图,理解数据趋势 |
| 代码审查 | 只能看代码文本 | 同时看代码+UI截图+设计稿对比 |
| 文档处理 | 纯文本解析 | 扫描文档图片,提取表格/图表信息 |
| 桌面自动化 | 无法感知屏幕状态 | 可以截图感知当前屏幕状态并决策 |
4.2 三种图片输入方式
┌─────────────────────────────────────────────────────────────────┐
│ 三种图片传入方式对比 │
├───────────────┬──────────────────┬───────────────┬──────────────┤
│ 方式 │ 说明 │ 优点 │ 限制 │
├───────────────┼──────────────────┼───────────────┼──────────────┤
│ Base64内联 │ 将图片编码为Base64 │ 无需额外存储 │ 单文件≤32MiB │
│ │ 直接放入请求体 │ 适合临时使用 │ 带宽消耗大 │
├───────────────┼──────────────────┼───────────────┼──────────────┤
│ 外部URL │ 传入图片的公开URL │ 无需上传 │ 需要URL可访问 │
│ │ │ 适合已有图床 │ 依赖网络 │
├───────────────┼──────────────────┼───────────────┼──────────────┤
│ Files API │ 先上传再通过 │ 可复用 │ 需先上传 │
│ (file_id) │ file_id引用 │ 节省带宽 │ 有存储配额 │
│ │ │ 单文件≤64MiB │ (25GiB/用户) │
└───────────────┴──────────────────┴───────────────┴──────────────┘
五、Files API与Harness集成
5.1 Files API详解
与Vision模型同步上线的Files API,为多模态Agent提供了文件存储基础设施:
┌─────────────────────────────────────────────────────────────────┐
│ Files API 架构 │
│ │
│ 用户上传 Files API 服务 Vision模型 │
│ ┌──────┐ ┌──────────────┐ ┌──────────┐ │
│ │ 图片 │ ──upload──▶ │ 文件存储 │ ──read──▶ │ 视觉理解 │ │
│ │ │ │ ┌──────────┐ │ file_id │ │ │
│ │ │ │ │ 25GiB/用户│ │ │ │ │
│ │ │ │ │ 最多10000 │ │ │ │ │
│ │ │ │ │ 个文件 │ │ │ │ │
│ │ │ │ └──────────┘ │ │ │ │
│ │ │ ◀───返回─────│ file_id │ │ │ │
│ └──────┘ file_id └──────────────┘ └──────────┘ │
│ │
│ Files API 规格: │
│ • 免费使用 (仅模型读图按Token计费) │
│ • 支持格式: JPEG / PNG / GIF / WebP │
│ • 单文件上限: 64 MiB │
│ • 存储配额: 25 GiB / 用户, 最多10000个文件 │
│ • 有效期: 1小时~30天可设, 不设则永久保留 │
│ • 接口: 上传 / 查询 / 引用(file_id) / 删除 (无下载接口) │
└─────────────────────────────────────────────────────────────────┘
Files API的设计亮点在于免费 + 可复用。同一张图片在多个请求中无需重复上传,通过file_id直接引用,既节省带宽又降低延迟。这对于需要连续分析长文档、网页截图和多轮视觉Agent任务的场景尤为实用。
5.2 DeepSeek Harness深度集成
Vision Exp发布后仅一周,DeepSeek Harness就更新到v0.1.1版本,开箱即用支持新模型:
┌─────────────────────────────────────────────────────────────────┐
│ DeepSeek Harness + Vision-Exp 集成架构 │
│ │
│ ┌─────────────────────────────────────────────────────────┐ │
│ │ DeepSeek Harness (v0.1.1) │ │
│ │ ┌───────────────────────────────────────────────────┐ │ │
│ │ │ Cordis 插件内核 │ │ │
│ │ │ ┌─────────────┐ ┌─────────────┐ ┌─────────────┐ │ │ │
│ │ │ │ 模型适配器 │ │ 工具注册表 │ │ 会话管理 │ │ │ │
│ │ │ │ (Vision-Exp)│ │ (文件/终端/ │ │ (图文混合) │ │ │ │
│ │ │ │ (默认视觉) │ │ 搜索/代码) │ │ │ │ │ │
│ │ │ └──────┬──────┘ └─────────────┘ └─────────────┘ │ │ │
│ │ │ │ │ │ │
│ │ │ ┌──────▼──────────────────────────────────────┐ │ │ │
│ │ │ │ 多模态Agent循环 (Agent Loop) │ │ │ │
│ │ │ │ ┌─────────┐ ┌─────────┐ ┌───────────────┐ │ │ │ │
│ │ │ │ │ /goal │ │ /plan │ │ @菜单引用文件 │ │ │ │ │
│ │ │ │ │ 图文输入 │ │ 图文输入 │ │ 和会话 │ │ │ │ │
│ │ │ │ └─────────┘ └─────────┘ └───────────────┘ │ │ │ │
│ │ │ └──────────────────────────────────────────────┘ │ │ │
│ │ └───────────────────────────────────────────────────┘ │ │
│ │ │ │
│ │ ┌───────────────────────────────────────────────────┐ │ │
│ │ │ 运行模式: 标准 / PTC / 极简 / 创造 │ │ │
│ │ │ MCP/ACP: 图片附件持久化 / PTC: 转发嵌套图片 │ │ │
│ │ └───────────────────────────────────────────────────┘ │ │
│ └─────────────────────────────────────────────────────────┘ │
│ │
│ ┌─────────────────────┐ │
│ │ V4-Flash-Vision-Exp │◀── 默认视觉模型 │
│ │ (API: deepseek- │ │
│ │ v4-flash-vision- │ │
│ │ exp) │ │
│ └─────────────────────┘ │
└─────────────────────────────────────────────────────────────────┘
Harness的更新要点包括:
- 模型列表更新后即可调用Vision Exp,官方设为默认视觉模型
/goal、/plan等命令支持图文混合输入@菜单可引用文件与会话中的图片- MCP/ACP同时支持图片附件持久化
- PTC Mode支持转发嵌套图片
- 修复了图片尺寸过大、历史图片载荷过高导致模型请求失败的问题
六、代码示例:上手实践
6.1 Python:调用V4-Flash-Vision-Exp进行多模态理解
import requests
import base64
import json
# DeepSeek API配置
API_KEY = "sk-your-deepseek-api-key"
BASE_URL = "https://api.deepseek.com/v1"
def encode_image(file_path):
"""将图片文件编码为Base64"""
with open(file_path, "rb") as f:
return base64.b64encode(f.read()).decode("utf-8")
def vision_agent_invoke(image_path, prompt, model="deepseek-v4-flash-vision-exp"):
"""
多模态Agent调用:传入图片+文本指令,返回模型理解结果
"""
base64_image = encode_image(image_path)
headers = {
"Authorization": f"Bearer {API_KEY}",
"Content-Type": "application/json"
}
payload = {
"model": model,
"messages": [
{
"role": "user",
"content": [
{
"type": "image_url",
"image_url": {
"url": f"data:image/png;base64,{base64_image}",
"detail": "auto" # low/original/auto
}
},
{
"type": "text",
"text": prompt
}
]
}
],
"max_tokens": 4096,
"temperature": 0.7
}
response = requests.post(
f"{BASE_URL}/chat/completions",
headers=headers,
json=payload
)
return response.json()
# 使用示例:分析网页截图并执行操作
result = vision_agent_invoke(
image_path="./screenshot_dashboard.png",
prompt="""请分析这张仪表盘截图,完成以下任务:
1. 提取所有可见的KPI指标及其数值
2. 识别图表类型和数据趋势
3. 判断是否存在异常数据点
4. 如果发现异常,给出排查建议"""
)
print(json.dumps(result, indent=2, ensure_ascii=False))
6.2 Python:使用Files API实现图片复用
import requests
def upload_file_to_deepseek(file_path, purpose="vision"):
"""上传文件到DeepSeek Files API,返回file_id"""
headers = {
"Authorization": f"Bearer {API_KEY}"
}
with open(file_path, "rb") as f:
files = {"file": f}
data = {"purpose": purpose}
response = requests.post(
f"{BASE_URL}/files",
headers=headers,
files=files,
data=data
)
return response.json()["id"] # 返回file_id
def list_files():
"""查询已上传的文件列表"""
headers = {"Authorization": f"Bearer {API_KEY}"}
response = requests.get(f"{BASE_URL}/files", headers=headers)
return response.json()
def delete_file(file_id):
"""删除已上传的文件"""
headers = {"Authorization": f"Bearer {API_KEY}"}
response = requests.delete(
f"{BASE_URL}/files/{file_id}",
headers=headers
)
return response.status_code == 204
# 使用file_id引用图片进行多轮对话
file_id = upload_file_to_deepseek("./chart_analysis.png")
# 第一轮:分析图表
response1 = requests.post(
f"{BASE_URL}/chat/completions",
headers={"Authorization": f"Bearer {API_KEY}"},
json={
"model": "deepseek-v4-flash-vision-exp",
"messages": [{
"role": "user",
"content": [
{"type": "file_id", "file_id": file_id},
{"type": "text", "text": "分析这张图表的数据趋势"}
]
}]
}
)
# 第二轮:同一张图继续追问(无需重新上传)
response2 = requests.post(
f"{BASE_URL}/chat/completions",
headers={"Authorization": f"Bearer {API_KEY}"},
json={
"model": "deepseek-v4-flash-vision-exp",
"messages": [{
"role": "user",
"content": [
{"type": "file_id", "file_id": file_id},
{"type": "text", "text": "基于图表的异常数据点,给出排查建议"}
]
}]
}
)
6.3 Python:工具调用(Tool Calls)+ 视觉理解结合
def multimodal_agent_with_tools():
"""
多模态Agent:视觉理解 + 工具调用组合
场景:读取报错截图 -> 搜索解决方案 -> 生成修复代码
"""
error_screenshot = "./error_screenshot.png"
file_id = upload_file_to_deepseek(error_screenshot)
# 第一步:识别报错内容
identify_response = requests.post(
f"{BASE_URL}/chat/completions",
headers={"Authorization": f"Bearer {API_KEY}"},
json={
"model": "deepseek-v4-flash-vision-exp",
"messages": [{
"role": "user",
"content": [
{"type": "file_id", "file_id": file_id},
{
"type": "text",
"text": "请识别这张截图中的错误信息,"
"提取错误类型、错误代码和关键堆栈信息"
}
]
}],
"tools": [{
"type": "function",
"function": {
"name": "search_web",
"description": "搜索互联网获取信息",
"parameters": {
"type": "object",
"properties": {
"query": {
"type": "string",
"description": "搜索关键词"
}
},
"required": ["query"]
}
}
}],
"tool_choice": "auto"
}
)
return identify_response.json()
# 执行多模态Agent
result = multimodal_agent_with_tools()
print(result["choices"][0]["message"]["content"])
6.4 Go:Responses API调用示例
package main
import (
"bytes"
"encoding/base64"
"encoding/json"
"fmt"
"io/ioutil"
"net/http"
)
type VisionRequest struct {
Model string `json:"model"`
Messages []Message `json:"messages"`
MaxTokens int `json:"max_tokens"`
}
type Message struct {
Role string `json:"role"`
Content []Content `json:"content"`
}
type Content struct {
Type string `json:"type"`
Text string `json:"text,omitempty"`
ImageURL *ImageURL `json:"image_url,omitempty"`
}
type ImageURL struct {
URL string `json:"url"`
Detail string `json:"detail"`
}
func main() {
apiKey := "sk-your-deepseek-api-key"
// 读取图片并编码
imgData, _ := ioutil.ReadFile("./chart.png")
base64Img := base64.StdEncoding.EncodeToString(imgData)
// 构建请求体
reqBody := VisionRequest{
Model: "deepseek-v4-flash-vision-exp",
Messages: []Message{
{
Role: "user",
Content: []Content{
{
Type: "image_url",
ImageURL: &ImageURL{
URL: fmt.Sprintf("data:image/png;base64,%s", base64Img),
Detail: "high",
},
},
{
Type: "text",
Text: "分析这张图表,提取关键数据点和趋势",
},
},
},
},
MaxTokens: 4096,
}
body, _ := json.Marshal(reqBody)
// 发送请求
req, _ := http.NewRequest("POST",
"https://api.deepseek.com/v1/responses",
bytes.NewBuffer(body))
req.Header.Set("Authorization", "Bearer "+apiKey)
req.Header.Set("Content-Type", "application/json")
client := &http.Client{}
resp, _ := client.Do(req)
var result map[string]interface{}
json.NewDecoder(resp.Body).Decode(&result)
fmt.Printf("%+v\n", result)
}
6.5 DeepSeek Harness配置:接入Vision-Exp模型
# harness-config.yaml
# DeepSeek Harness 模型配置 - 启用Vision-Exp
models:
default: deepseek-v4-flash-vision-exp
providers:
deepseek:
api_key: ${DEEPSEEK_API_KEY}
base_url: https://api.deepseek.com/v1
models:
- name: deepseek-v4-flash-vision-exp
multimodal: true # 启用多模态支持
max_images: 600 # 单次请求最大图片数
image_size_limit: 64 # MiB
supports_files_api: true
- name: deepseek-v4-flash
multimodal: false # 纯文本模型
- name: deepseek-v4-pro
multimodal: false
agent:
mode: standard # standard / ptc / minimal / creative
# 视觉Agent配置
vision:
default_detail: auto # low / original / auto
max_image_tokens: 384 # 单张图片最大Token数
enable_file_referencing: true # 启用Files API引用
auto_compress_large_images: true # 自动压缩大图
tools:
- file_editor
- terminal
- web_search
- code_executor
- image_analysis # 新增:图片分析工具
七、价格与性价比深度分析
7.1 定价模型
V4-Flash-Vision-Exp的API价格与V4-Flash完全一致,没有因为新增视觉能力而涨价:
┌─────────────────────────────────────────────────────────────────┐
│ V4-Flash-Vision-Exp 定价 (每百万Token) │
├───────────────┬──────────────────────┬──────────────────────────┤
│ 计费项 │ 空闲时段 │ 高峰时段 │
│ │ (00:00-09:00, │ (09:00-12:00, │
│ │ 18:00-24:00) │ 14:00-18:00) │
├───────────────┼──────────────────────┼──────────────────────────┤
│ 输入(缓存命中) │ 0.05 元 │ 0.10 元 │
│ 输入(缓存未命中)│ 1.5 元 │ 3.0 元 │
│ 输出 │ 4.5 元 │ 9.0 元 │
├───────────────┴──────────────────────┴──────────────────────────┤
│ │
│ 图片Token折算规则: │
│ • low模式: 缩放到512×512, 固定Token消耗 │
│ • original/auto模式: 按实际尺寸折算, 单张最多384 Tokens │
│ • 一张图片最低成本: 384 × 1.5/1e6 ≈ 0.000576元 (约0.06分钱) │
│ • 高峰时段: 约0.12分钱/张 │
└─────────────────────────────────────────────────────────────────┘
7.2 与竞品价格对比
┌──────────────────┬──────────────┬──────────────┬───────────────┐
│ 模型 │ 输入价格 │ 输出价格 │ 视觉附加费 │
│ │ (每百万Token) │ (每百万Token) │ │
├──────────────────┼──────────────┼──────────────┼───────────────┤
│ DeepSeek V4- │ 1.5~3元 │ 4.5~9元 │ 无 (图片折算 │
│ Flash-Vision-Exp │ (闲时~高峰) │ (闲时~高峰) │ Token统一计费)│
├──────────────────┼──────────────┼──────────────┼───────────────┤
│ GPT-5.6 Sol │ ~$15/百万 │ ~$60/百万 │ 单独图片计费 │
│ Vision │ (~105元) │ (~420元) │ │
├──────────────────┼──────────────┼──────────────┼───────────────┤
│ Gemini 3.7 Flash │ ~$0.15/百万 │ ~$0.60/百万 │ 按图片尺寸 │
│ │ (~1.05元) │ (~4.2元) │ 额外计费 │
├──────────────────┼──────────────┼──────────────┼───────────────┤
│ Qwen3.8-VL │ ~¥2/百万 │ ~¥8/百万 │ 无 (统一计费) │
├──────────────────┼──────────────┼──────────────┼───────────────┤
│ Opus-4.8 │ ~$5/百万 │ ~$55/百万 │ 按图片Token │
│ │ (~35元) │ (~385元) │ 计费 │
└──────────────────┴──────────────┴──────────────┴───────────────┘
性价比分析:
- 对比Opus-4.8:DeepSeek的输入价格仅为Opus-4.8的约1/23,输出价格约1/43。在多模态Agent能力接近的情况下,价格差距极为显著。
- 对比GPT-5.6 Sol Vision:DeepSeek的输入价格约为1/70,输出价格约为1/47。对于需要大量视觉Agent调用的场景,成本优势是压倒性的。
- 对比Gemini 3.7 Flash:Gemini Flash虽然输入价格更低,但输出价格相近,且Gemini对图片有额外的尺寸计费规则。DeepSeek将图片折算为Token统一计费,对开发者更透明。
- 对比Qwen3.8-VL:价格相近,但DeepSeek在Agent能力上有明显优势。
7.3 峰谷定价策略的深意
DeepSeek于8月13日引入峰谷定价机制(高峰时段价格为闲时的2倍),这在API定价中是一个相对少见的策略。其背后的逻辑是:
- 引导错峰使用:将非关键任务调度到闲时,降低用户成本的同时也平衡了服务器负载
- 缓存命中的极致优惠:缓存命中时闲时仅0.05元/百万Token,适合高频重复的视觉任务(如批量分析同类截图)
- 为大规模Agent部署铺路:对于需要7×24小时运行的生产级Agent,可以通过合理调度将成本控制在极低水平
八、与竞品全面对比
8.1 多模态模型横向对比
┌──────────────────────┬──────────┬────────────┬──────────┬──────────┐
│ 维度 │ DeepSeek │ GPT-5.6 │ Gemini │ Qwen3.8 │
│ │ V4-Flash │ Sol Vision │ 3.7 Flash │ -VL │
│ │ -Vision↵ │ │ │ │
├──────────────────────┼──────────┼────────────┼──────────┼──────────┤
│ 开源 │ ❌(API) │ ❌ │ ❌ │ ✅(部分) │
│ 上下文窗口 │ 1M │ 1M │ 2M │ 128K │
│ 最大输出长度 │ 384K │ 128K │ 64K │ 32K │
│ 图片格式 │ 4种 │ 多种 │ 多种 │ 多种 │
│ 视频输入 │ ❌ │ ✅ │ ✅ │ ❌ │
│ Agent能力 │ 🟢强 │ 🟢强 │ 🟡中 │ 🟡中 │
│ 工具调用 │ ✅ │ ✅ │ ✅ │ ✅ │
│ JSON Output │ ✅ │ ✅ │ ✅ │ ✅ │
│ Responses API │ ✅ │ ✅ │ ❌ │ ❌ │
│ Anthropic API兼容 │ ✅ │ ❌ │ ❌ │ ❌ │
│ Files API │ ✅(免费)│ ✅(收费) │ ✅(收费) │ ❌ │
│ 价格(输入/输出,元/ │ 1.5~3/ │ ~105/~420 │ ~1.05/ │ ~2/~8 │
│ 百万Token) │ 4.5~9 │ │ ~4.2 │ │
│ 峰谷定价 │ ✅ │ ❌ │ ❌ │ ❌ │
│ 国产算力适配 │ ✅(昇腾)│ ❌ │ ❌ │ ✅ │
└──────────────────────┴──────────┴────────────┴──────────┴──────────┘
8.2 核心差异化分析
vs GPT-5.6 Sol Vision:GPT-5.6 Sol Vision是OpenAI的最新多模态模型,在综合能力上仍处于领先地位。但DeepSeek的差异化优势在于:
- Agent优先设计:Vision Exp从架构上就是为Agent场景设计的,在工具调用、长上下文、多轮交互方面有天然优势
- 极致性价比:价格仅为GPT-5.6 Sol Vision的约1/50
- API兼容性:同时支持OpenAI Chat Completions、Responses API和Anthropic API三种格式,迁移成本极低
vs Gemini 3.7 Flash:Gemini 3.7 Flash在多模态原生能力(尤其是视频理解)上仍有优势,但在Agent场景中:
- 上下文窗口虽大(2M),但Agent任务对工具调用的支持不如DeepSeek深入
- 不支持Responses API和Anthropic API格式
- 价格在输出端与DeepSeek相近,但输入端的极低价格优势被图片额外计费部分抵消
vs Qwen3.8-VL:Qwen3.8-VL是阿里通义的最新多模态模型,在中文场景有竞争力:
- 价格相近,但Qwen的上下文窗口(128K)远小于DeepSeek(1M)
- Agent能力差距明显,尤其在复杂工具调用和长任务执行上
- DeepSeek的Files API免费策略更具吸引力
8.3 开源生态对比
虽然Vision Exp本身尚未开源(仅通过API提供服务),但DeepSeek Harness的完全开源(MIT协议)为其生态提供了关键支撑。相比之下,GPT-5.6 Sol Vision和Gemini 3.7 Flash均为闭源,开发者无法在框架层面进行深度定制。
九、行业影响与未来展望
9.1 对多模态Agent赛道的影响
V4-Flash-Vision-Exp的发布,标志着开源多模态Agent进入了一个新阶段:
降低了多模态Agent的准入门槛:在此之前,构建一个能"看"的Agent至少需要组合两个模型(视觉模型+推理模型),现在只需一个API调用。Files API的免费策略进一步降低了存储和带宽成本。
加速了Agent工具的视觉化演进:随着Harness对视觉能力的原生支持,越来越多的Agent工具将自然融入视觉感知——终端操作可以结合截图理解,代码编辑可以结合UI设计稿,搜索可以结合图片内容。
推动了"看-思考-行动"闭环的完善:DeepSeek正在构建的不仅是一个视觉模型,而是一套完整的"感知-推理-行动"闭环:
DeepSeek多模态Agent闭环
┌───────────────┐
│ 感知(Perceive) │
│ V4-Flash- │
│ Vision-Exp │
│ 图片/截图/图表 │
└───────┬───────┘
│
▼
┌───────────────┐
│ 思考(Reason) │
│ V4-Flash核心 │
│ 推理引擎 │
│ 1M上下文 │
└───────┬───────┘
│
▼
┌───────────────┐
│ 行动(Act) │
│ DeepSeek │
│ Harness │
│ 工具/代码/终端 │
└───────┬───────┘
│
└─────────► 循环反馈
9.2 潜在局限与待观察问题
- 实验性质(Exp后缀):不推荐直接用于生产环境,接口和行为可能调整
- 仅支持图片:不支持视频输入,在多模态感知维度上仍有短板
- 架构不透明:未公布技术报告,视觉编码器架构、训练方式、参数规模等关键信息缺失
- 第三方评测待验证:官方自测数据需要第三方独立评测交叉验证
- 纯文本任务中的细微差距:在Cybergym等安全基准上,Vision Exp比V4-Flash低了1.4分,说明视觉能力的加入对某些纯文本任务有轻微影响
9.3 未来展望
基于DeepSeek的产品路线图和行业发展趋势,可以做出以下合理预期:
- 正式版(非Exp)的推出:预计在1-2个月内,基于社区反馈迭代后推出正式版,可能伴随技术报告的发布
- V4-Pro-Vision的可能性:将视觉能力接入V4-Pro,推出更强的多模态旗舰模型
- 视频理解能力的加入:中长期来看,视频理解是必然方向
- 模型开源的可能性:参考DeepSeek一贯的开源策略,正式版后开源权重模型存在较大可能
- 与Claude Code/Codex的竞争:随着Harness + Vision-Exp的组合成熟,将直接对标Claude Code和OpenAI Codex
十、开发者实践建议
10.1 上手路线图
对于希望快速上手V4-Flash-Vision-Exp的开发者,建议按以下步骤推进:
- 环境准备:获取DeepSeek API密钥,确认API账户余额充足(建议至少充值50元用于测试)
- 基础调用测试:使用Python SDK或cURL测试单张图片的视觉理解能力,验证模型是否能正确识别你的图片内容
- Files API集成:将经常使用的图片上传至Files API,通过file_id复用,观察多轮对话中的图片引用效果
- Harness本地部署:安装DeepSeek Harness v0.1.1以上版本,配置Vision-Exp为默认视觉模型,体验图文混合的Agent工作流
- 场景化开发:选择你最熟悉的Agent场景(如网页自动化、报错诊断、数据分析等),构建完整的"视觉理解→推理→工具调用"闭环
10.2 最佳实践
- 图片预处理:对于大尺寸图片(>4K分辨率),建议先压缩再上传,避免不必要的Token消耗。单张图片384 Token的上限意味着超大图片可能被压缩到较低分辨率
- 缓存策略:对于高频重复的视觉任务(如监控面板截图分析),利用缓存命中机制(空闲时段仅0.05元/百万Token),将任务调度到非高峰时段执行
- 细节模式选择:简单图标识别用
low模式节省Token,图表分析用original模式保留细节,不确定时使用auto让系统自动判断 - 多图组合:单次请求最多支持600张图片,适合批量截图的对比分析场景,但需注意总Token消耗
- 错误处理:建议在代码中加入重试逻辑和降级策略(如图片加载失败时回退到纯文本模式)
10.3 需避开的坑
- Exp版本接口可能变更,重要生产任务请不要直接依赖当前API行为
- 不支持视频输入,如果需要视频理解,仍需结合其他模型或自行拆分视频帧
- Files API存储空间有限(25GiB/用户),建议定期清理不再需要的文件,避免存储满导致上传失败
- 图片的Token折算规则可能在未来调整,建议关注官方文档更新
- 第三方评测尚未发布,官方自测数据仅供参考,不要以此作为唯一选型依据
十一、总结
DeepSeek V4-Flash-Vision-Exp的发布,与其说是一个"视觉模型"的上线,不如说是DeepSeek多模态Agent基础设施的关键拼图——它让模型、图片、文件、工具和Agent执行链开始连在一起。
核心三点:
- 文本能力无损:在Agent、推理、世界知识等纯文本能力上与V4-Flash持平,视觉能力的加入没有"拖累"文本推理
- 多模态Agent能力跃升:在需要视觉理解的Agent基准上大幅提升,接近Opus-4.8水平
- 极致性价比:价格与V4-Flash完全一致,视觉理解成本极低(一张图约0.06分钱),在Agent场景中具有显著的成本优势
对于开发者而言,现在是上手尝试的最佳时机——Exp版本虽然不建议用于生产环境,但正适合在真实场景中探索多模态Agent的可能性,并向DeepSeek反馈使用体验。毕竟,一个"能看见"的开源Agent生态,才刚刚开始。
参考资料:DeepSeek API官方更新日志(api-docs.deepseek.com/updates/)、36氪报道、凤凰网科技、InfoQ、新京报、IT之家、The Next Web