DeepSeek V4-Flash-Vision-Exp深度解析:开源多模态Agent的新里程碑

一、引言:当DeepSeek终于"睁开眼睛"

2026年8月21日下午,DeepSeek官方API文档悄然出现了一个新模型名称:deepseek-v4-flash-vision-exp。没有盛大的发布会,没有万字技术报告——但这一行模型名称的背后,意味着DeepSeek V4系列首次直接支持图片输入,正式从纯文本迈入多模态时代。

如果说一周前(8月13日)DeepSeek开源Agent Harness是"给AI装上了手脚",那么V4-Flash-Vision-Exp的发布就是"给AI装上了眼睛"。这两个事件在时间上的紧密衔接并非巧合——它们共同指向一个更宏大的目标:构建一套完整的开源多模态Agent基础设施

在此之前,DeepSeek Harness的GitHub讨论区里,“怎么让DeepSeek看图"已经成为一个高频问题。开发者上传图片时,Harness直接返回MODEL_DOES_NOT_SUPPORT_IMAGES,社区不得不自行开发"视觉桥接"插件(如dsh-deepseek-vision),先借助Qwen-VL等模型理解图片,再将文本描述传给DeepSeek。这种略显尴尬的"借眼"局面,终于在V4-Flash-Vision-Exp上线后画上句号。


二、DeepSeek V4系列演进路线:从纯文本到多模态

2.1 V4系列模型全景回顾

DeepSeek V4系列于2026年4月24日正式发布,采用双旗舰架构:

┌─────────────────────────────────────────────────────────────┐
│                    DeepSeek V4 家族架构图                     │
├─────────────────────────────────────────────────────────────┤
│                                                             │
│  V4-Pro (旗舰推理)          V4-Flash (高效推理)              │
│  ┌─────────────────┐      ┌─────────────────┐              │
│  │ 总参数: 1.6T     │      │ 总参数: 284B    │              │
│  │ 激活参数: 49B    │      │ 激活参数: 13B   │              │
│  │ 训练数据: 33T    │      │ 训练数据: 32T   │              │
│  │ 上下文: 1M       │      │ 上下文: 1M      │              │
│  └─────────────────┘      └─────────────────┘              │
│           │                         │                       │
│           └─────────┬───────────────┘                       │
│                     │                                       │
│          ┌──────────▼──────────┐                            │
│          │  共同架构基础         │                            │
│          │  • MoE + 混合注意力   │                            │
│          │  • CSA + HCA 双重压缩 │                            │
│          │  • mHC 流形约束超连接 │                            │
│          │  • mxFP4 训练精度     │                            │
│          │  • 三档推理强度       │                            │
│          └─────────────────────┘                            │
│                                                             │
│  2026-08-21:  V4-Flash-Vision-Exp (多模态实验版)             │
│               ┌─────────────────────┐                       │
│               │ 文本能力 ≈ V4-Flash │                       │
│               │ + 原生图片输入       │                       │
│               │ + 1M上下文 / 384K输出│                       │
│               │ + 多模态Agent能力    │                       │
│               └─────────────────────┘                       │
└─────────────────────────────────────────────────────────────┘

V4-Pro:总参数1.6万亿(1.6T),每Token激活49B参数,定位旗舰推理。在Codeforces竞赛评级达到3206分(人类第23名),SWE-bench Verified达81%,代表了开源模型推理能力的最高水平。

V4-Flash:总参数284B,每Token仅激活13B参数,定位高吞吐、低成本。在Agent任务上表现出色,Terminal Bench 2.1达82.7分,是性价比最高的开源Agent模型之一。

两者均为纯文本模型,支持1M上下文窗口,采用MoE + 混合注意力机制(CSA压缩稀疏注意力 + HCA重度压缩注意力),并引入了流形约束超连接(mHC)和mxFP4训练精度等创新。

2.2 从V4-Flash到Vision-Exp:关键演进脉络

时间线:DeepSeek V4系列关键里程碑

2026-04-24  ──  V4预览版发布 (V4-Pro + V4-Flash,纯文本)
                │
                │  • MIT协议全量开源
                │  • 1M上下文,MoE架构
                │  • 无多模态能力
                ▼
2026-07-31  ──  V4-Flash正式版公测
                │
                │  • Agent能力大幅增强
                │  • 原生支持Responses API
                │  • 适配Codex
                ▼
2026-08-13  ──  V4-Pro GA版 + DeepSeek Harness开源
                │
                │  • 开源Agent Harness (v0.1.0-rc.6)
                │  • 全插件化架构(Cordis)
                │  • 但模型仍不支持图片输入
                ▼
2026-08-14~20 ── Harness rc.7/rc.8更新
                │
                │  • 增强多模态支持度
                │  • 模型适配器支持原生图片请求
                │  • 社区自制"视觉桥接"插件涌现
                ▼
2026-08-21  ──  V4-Flash-Vision-Exp上线 🎯
                │
                │  • 首个原生视觉模型
                │  • Files API同步上线
                │  • Harness v0.1.1开箱即用支持
                │  • 多模态Agent能力接近Opus-4.8

2.3 为什么是V4-Flash而非V4-Pro承载视觉能力?

这是一个值得关注的产品决策。Vision Exp被放在了V4-Flash产品线中,而非V4-Pro。这意味着DeepSeek现阶段优先将视觉能力接入更小、更快、更便宜的模型。

V4-Flash本身只有284B总参数、13B激活参数,定位就是高吞吐、低成本。如果Vision版本延续这一定位,它瞄准的很可能不是单纯的图片聊天,而是大量发生在Agent里的视觉任务——读网页截图、识别报错界面、分析图表、查看软件UI、读取设计稿,再根据图片继续操作电脑或修改代码。这些任务对"单次图片理解达到最强"未必有极端要求,却非常在意速度、价格以及能否连续运行。


三、V4-Flash-Vision-Exp架构深度分析

3.1 架构推测:视觉前端 + 文本推理的组合方案

虽然DeepSeek尚未公布Vision Exp的完整技术报告,但结合现有信息可以做出合理推断:

┌─────────────────────────────────────────────────────────────────┐
│              V4-Flash-Vision-Exp 推测架构图                       │
│                                                                 │
│  用户输入                                                       │
│   ┌──────────────┐                                              │
│   │ 文本 + 图片   │                                              │
│   └──────┬───────┘                                              │
│          │                                                       │
│          ▼                                                       │
│  ┌──────────────────┐                                           │
│  │  视觉编码前端      │  ← 新增模块 (Vision Encoder)              │
│  │  ┌──────────────┐ │                                           │
│  │  │ 图片解析       │ │  • JPEG/PNG/GIF/WebP                    │
│  │  │ 尺寸归一化     │ │  • 三种细节模式: low/original/auto       │
│  │  │ Token折算      │ │  • 单张封顶384 Tokens                   │
│  │  └──────┬───────┘ │                                           │
│  └─────────┼─────────┘                                           │
│            │                                                     │
│            ▼                                                     │
│  ┌────────────────────────────────────┐                          │
│  │  V4-Flash 核心推理引擎 (文本)       │  ← 保持不变的文本能力      │
│  │  ┌──────────┐ ┌──────────┐        │                          │
│  │  │ CSA注意力  │ │ HCA注意力 │        │                          │
│  │  │ 压缩稀疏   │ │ 重度压缩  │        │                          │
│  │  │ 注意力     │ │ 注意力    │        │                          │
│  │  └──────────┘ └──────────┘        │                          │
│  │  ┌────────────────────────────┐  │                          │
│  │  │  MoE专家层 (284B总/13B激活) │  │                          │
│  │  │  1 shared + 256 routed     │  │                          │
│  │  │  每Token激活6个Expert      │  │                          │
│  │  └────────────────────────────┘  │                          │
│  └────────────────────────────────────┘                          │
│            │                                                     │
│            ▼                                                     │
│  ┌──────────────────┐                                           │
│  │  输出 (文本/JSON/  │                                           │
│  │  Tool Calls/     │                                           │
│  │  Responses API)  │                                           │
│  └──────────────────┘                                           │
│                                                                 │
│  ⚡ 关键特征:                                                     │
│  • 视觉编码Token与文本Token统一计费                                │
│  • 单张图片最多折算384 Tokens                                     │
│  • 价格与V4-Flash完全一致,无视觉附加费                             │
│  • 不支持视频输入                                                 │
└─────────────────────────────────────────────────────────────────┘

关键推断:Vision Exp可能并非端到端统一训练的原生多模态模型,而是将视觉编码模块(Vision Encoder)接入V4-Flash文本推理引擎的前端。图片经过视觉编码器转换为Token序列后,与文本Token拼接,送入V4-Flash核心引擎进行统一推理。这种架构与Gemini、GPT系列更强调统一多模态预训练的路线存在区别,但具备工程实现快、成本低、不牺牲文本能力的优势。

3.2 核心能力矩阵

┌─────────────────────────────────────────────────────────────────┐
│               V4-Flash-Vision-Exp 能力全景                       │
├───────────────┬─────────────────────────────────────────────────┤
│   能力维度     │                  具体指标                        │
├───────────────┼─────────────────────────────────────────────────┤
│ 上下文窗口     │ 1M Tokens (100万)                               │
│ 最大输出长度   │ 384K Tokens                                     │
│ 图片格式       │ JPEG / PNG / GIF / WebP                         │
│ 图片上限       │ 单次请求最多600张图片                             │
│ 图片分辨率     │ 最长边支持8192像素                                │
│ 单文件大小     │ 64 MiB (Files API) / 32 MiB (内联)              │
│ 图片细节模式   │ low(512×512) / original(保留原图) / auto(等同原图)│
│ 单张Token上限  │ 384 Tokens                                      │
│ API格式        │ Chat Completions / Messages / Responses         │
│                │ Anthropic API / 对话前缀续写                     │
│ 功能支持       │ JSON Output / Tool Calls / Function Calling     │
│ 图片传入方式   │ Base64内联 / 外部URL / Files API (file_id)       │
│ 推理强度控制   │ low / high / max 三档                             │
└───────────────┴─────────────────────────────────────────────────┘

3.3 Benchmark表现分析

DeepSeek官方公布了11项基准测试结果(使用DeepSeek Harness极简模式,max档,temperature=1.0,top-p=0.95):

┌──────────────────────────┬──────────┬──────────┬──────────┐
│        基准测试           │ Vision-Exp│ V4-Flash │Opus-4.8  │
├──────────────────────────┼──────────┼──────────┼──────────┤
│ Terminal Bench 2.1       │   83.9   │   82.7   │   85.0   │
│ NL2Repo                  │   57.7   │   54.2   │   69.7   │
│ DeepSWE                  │   59.3   │   54.4   │   58.0   │
│ DSBench-Hard             │   63.6   │   59.6   │   71.7   │
│ AutomationBench (Public) │   25.7   │   25.1   │   27.2   │
│ ApexBench (Pass@1)       │   36.5   │   26.2*  │   39.4   │
│ Agents' Last Exam        │   27.3   │   25.2*  │   25.7   │
│ Chartography             │   64.3   │    —     │   65.0   │
│ ZeroBench (Pass@5)       │   35.0   │    —     │   34.0   │
│ Toolathlon-Verified      │   75.9   │   70.3   │   76.2   │
│ Cybergym                 │   75.3   │   76.7   │    —     │
└──────────────────────────┴──────────┴──────────┴──────────┘
* V4-Flash为纯文本模型,在ApexBench和Agents' Last Exam中忽略多模态元素

关键解读

  1. 文本能力持平:在纯文本Agent任务上,Vision Exp与V4-Flash正式版基本持平,部分指标甚至略优(如Toolathlon-Verified提升5.6分,DeepSWE提升4.9分,DSBench-Hard提升4.0分),说明加入视觉能力并未"拖累"文本推理。

  2. 多模态Agent大幅跃升:在需要视觉理解的ApexBench(界面操作)上,Vision Exp的36.5分相比V4-Flash的26.2分提升近40%,已接近Opus-4.8的39.4分。

  3. 与Opus-4.8的差距:在11项基准中,Vision Exp在3项上超越Opus-4.8(DeepSWE +1.3、Agents’ Last Exam +1.6、ZeroBench +1.0),其余8项落后,但差距多在2分以内。最大的差距在NL2Repo(12分)和DSBench-Hard(8.1分)——这两项都是仓库级代码任务,说明在复杂编程场景中仍有提升空间。

  4. 需注意:以上均为官方自测,第三方复测(如Artificial Analysis、CLUE、Arena等)尚未发布,建议保持审慎态度。


四、多模态Agent能力详解

4.1 从"听描述"到"亲眼看”:Agent能力的质变

V4-Flash-Vision-Exp最核心的价值,不在于"看图说话"的图像识别能力,而在于将视觉感知直接嵌入Agent工作流。这意味着:

传统纯文本Agent工作流:
用户描述 → 文本理解 → 推理规划 → 工具调用 → 执行

多模态Agent工作流 (Vision Exp):
截图/图片 → 视觉理解 → 文本理解 → 推理规划 → 工具调用 → 执行
    ↑                                                    │
    └──────────────── 循环反馈 ────────────────────────────┘

典型多模态Agent场景

场景之前(纯文本)现在(Vision Exp)
Web自动化测试需手动提取DOM元素文本描述直接截图,模型理解UI布局并操作
报错诊断用户需手动复制错误信息直接截图报错界面,模型自动识别
数据分析需要结构化数据输入直接读取图表、截图,理解数据趋势
代码审查只能看代码文本同时看代码+UI截图+设计稿对比
文档处理纯文本解析扫描文档图片,提取表格/图表信息
桌面自动化无法感知屏幕状态可以截图感知当前屏幕状态并决策

4.2 三种图片输入方式

┌─────────────────────────────────────────────────────────────────┐
│                 三种图片传入方式对比                               │
├───────────────┬──────────────────┬───────────────┬──────────────┤
│    方式        │    说明           │   优点         │   限制        │
├───────────────┼──────────────────┼───────────────┼──────────────┤
│ Base64内联    │ 将图片编码为Base64 │ 无需额外存储   │ 单文件≤32MiB  │
│               │ 直接放入请求体     │ 适合临时使用    │ 带宽消耗大    │
├───────────────┼──────────────────┼───────────────┼──────────────┤
│ 外部URL       │ 传入图片的公开URL  │ 无需上传       │ 需要URL可访问 │
│               │                   │ 适合已有图床   │ 依赖网络      │
├───────────────┼──────────────────┼───────────────┼──────────────┤
│ Files API     │ 先上传再通过      │ 可复用         │ 需先上传      │
│ (file_id)     │ file_id引用      │ 节省带宽       │ 有存储配额    │
│               │                   │ 单文件≤64MiB  │ (25GiB/用户)  │
└───────────────┴──────────────────┴───────────────┴──────────────┘

五、Files API与Harness集成

5.1 Files API详解

与Vision模型同步上线的Files API,为多模态Agent提供了文件存储基础设施:

┌─────────────────────────────────────────────────────────────────┐
│                    Files API 架构                                │
│                                                                 │
│  用户上传               Files API 服务              Vision模型    │
│  ┌──────┐              ┌──────────────┐          ┌──────────┐  │
│  │ 图片  │ ──upload──▶ │  文件存储     │ ──read──▶ │ 视觉理解  │  │
│  │      │              │  ┌──────────┐ │  file_id  │          │  │
│  │      │              │  │ 25GiB/用户│ │          │          │  │
│  │      │              │  │ 最多10000 │ │          │          │  │
│  │      │              │  │ 个文件     │ │          │          │  │
│  │      │              │  └──────────┘ │          │          │  │
│  │      │ ◀───返回─────│  file_id      │          │          │  │
│  └──────┘   file_id    └──────────────┘          └──────────┘  │
│                                                                 │
│  Files API 规格:                                                │
│  • 免费使用 (仅模型读图按Token计费)                               │
│  • 支持格式: JPEG / PNG / GIF / WebP                            │
│  • 单文件上限: 64 MiB                                           │
│  • 存储配额: 25 GiB / 用户, 最多10000个文件                      │
│  • 有效期: 1小时~30天可设, 不设则永久保留                         │
│  • 接口: 上传 / 查询 / 引用(file_id) / 删除 (无下载接口)          │
└─────────────────────────────────────────────────────────────────┘

Files API的设计亮点在于免费 + 可复用。同一张图片在多个请求中无需重复上传,通过file_id直接引用,既节省带宽又降低延迟。这对于需要连续分析长文档、网页截图和多轮视觉Agent任务的场景尤为实用。

5.2 DeepSeek Harness深度集成

Vision Exp发布后仅一周,DeepSeek Harness就更新到v0.1.1版本,开箱即用支持新模型:

┌─────────────────────────────────────────────────────────────────┐
│        DeepSeek Harness + Vision-Exp 集成架构                    │
│                                                                 │
│  ┌─────────────────────────────────────────────────────────┐    │
│  │  DeepSeek Harness (v0.1.1)                              │    │
│  │  ┌───────────────────────────────────────────────────┐  │    │
│  │  │  Cordis 插件内核                                    │  │    │
│  │  │  ┌─────────────┐ ┌─────────────┐ ┌─────────────┐  │  │    │
│  │  │  │ 模型适配器   │ │ 工具注册表   │ │ 会话管理    │  │  │    │
│  │  │  │ (Vision-Exp)│ │ (文件/终端/  │ │ (图文混合)  │  │  │    │
│  │  │  │ (默认视觉)  │ │  搜索/代码)  │ │             │  │  │    │
│  │  │  └──────┬──────┘ └─────────────┘ └─────────────┘  │  │    │
│  │  │         │                                          │  │    │
│  │  │  ┌──────▼──────────────────────────────────────┐   │  │    │
│  │  │  │  多模态Agent循环 (Agent Loop)                │   │  │    │
│  │  │  │  ┌─────────┐ ┌─────────┐ ┌───────────────┐  │   │  │    │
│  │  │  │  │ /goal   │ │ /plan   │ │ @菜单引用文件  │  │   │  │    │
│  │  │  │  │ 图文输入 │ │ 图文输入 │ │ 和会话        │  │   │  │    │
│  │  │  │  └─────────┘ └─────────┘ └───────────────┘  │   │  │    │
│  │  │  └──────────────────────────────────────────────┘   │  │    │
│  │  └───────────────────────────────────────────────────┘  │    │
│  │                                                         │    │
│  │  ┌───────────────────────────────────────────────────┐  │    │
│  │  │  运行模式: 标准 / PTC / 极简 / 创造                │  │    │
│  │  │  MCP/ACP: 图片附件持久化 / PTC: 转发嵌套图片      │  │    │
│  │  └───────────────────────────────────────────────────┘  │    │
│  └─────────────────────────────────────────────────────────┘    │
│                                                                 │
│  ┌─────────────────────┐                                        │
│  │  V4-Flash-Vision-Exp │◀── 默认视觉模型                        │
│  │  (API: deepseek-    │                                        │
│  │   v4-flash-vision-  │                                        │
│  │   exp)              │                                        │
│  └─────────────────────┘                                        │
└─────────────────────────────────────────────────────────────────┘

Harness的更新要点包括:

  • 模型列表更新后即可调用Vision Exp,官方设为默认视觉模型
  • /goal/plan等命令支持图文混合输入
  • @菜单可引用文件与会话中的图片
  • MCP/ACP同时支持图片附件持久化
  • PTC Mode支持转发嵌套图片
  • 修复了图片尺寸过大、历史图片载荷过高导致模型请求失败的问题

六、代码示例:上手实践

6.1 Python:调用V4-Flash-Vision-Exp进行多模态理解

import requests
import base64
import json

# DeepSeek API配置
API_KEY = "sk-your-deepseek-api-key"
BASE_URL = "https://api.deepseek.com/v1"

def encode_image(file_path):
    """将图片文件编码为Base64"""
    with open(file_path, "rb") as f:
        return base64.b64encode(f.read()).decode("utf-8")

def vision_agent_invoke(image_path, prompt, model="deepseek-v4-flash-vision-exp"):
    """
    多模态Agent调用:传入图片+文本指令,返回模型理解结果
    """
    base64_image = encode_image(image_path)
    
    headers = {
        "Authorization": f"Bearer {API_KEY}",
        "Content-Type": "application/json"
    }
    
    payload = {
        "model": model,
        "messages": [
            {
                "role": "user",
                "content": [
                    {
                        "type": "image_url",
                        "image_url": {
                            "url": f"data:image/png;base64,{base64_image}",
                            "detail": "auto"  # low/original/auto
                        }
                    },
                    {
                        "type": "text",
                        "text": prompt
                    }
                ]
            }
        ],
        "max_tokens": 4096,
        "temperature": 0.7
    }
    
    response = requests.post(
        f"{BASE_URL}/chat/completions",
        headers=headers,
        json=payload
    )
    
    return response.json()

# 使用示例:分析网页截图并执行操作
result = vision_agent_invoke(
    image_path="./screenshot_dashboard.png",
    prompt="""请分析这张仪表盘截图,完成以下任务:
1. 提取所有可见的KPI指标及其数值
2. 识别图表类型和数据趋势
3. 判断是否存在异常数据点
4. 如果发现异常,给出排查建议"""
)

print(json.dumps(result, indent=2, ensure_ascii=False))

6.2 Python:使用Files API实现图片复用

import requests

def upload_file_to_deepseek(file_path, purpose="vision"):
    """上传文件到DeepSeek Files API,返回file_id"""
    headers = {
        "Authorization": f"Bearer {API_KEY}"
    }
    
    with open(file_path, "rb") as f:
        files = {"file": f}
        data = {"purpose": purpose}
        
        response = requests.post(
            f"{BASE_URL}/files",
            headers=headers,
            files=files,
            data=data
        )
    
    return response.json()["id"]  # 返回file_id

def list_files():
    """查询已上传的文件列表"""
    headers = {"Authorization": f"Bearer {API_KEY}"}
    response = requests.get(f"{BASE_URL}/files", headers=headers)
    return response.json()

def delete_file(file_id):
    """删除已上传的文件"""
    headers = {"Authorization": f"Bearer {API_KEY}"}
    response = requests.delete(
        f"{BASE_URL}/files/{file_id}",
        headers=headers
    )
    return response.status_code == 204

# 使用file_id引用图片进行多轮对话
file_id = upload_file_to_deepseek("./chart_analysis.png")

# 第一轮:分析图表
response1 = requests.post(
    f"{BASE_URL}/chat/completions",
    headers={"Authorization": f"Bearer {API_KEY}"},
    json={
        "model": "deepseek-v4-flash-vision-exp",
        "messages": [{
            "role": "user",
            "content": [
                {"type": "file_id", "file_id": file_id},
                {"type": "text", "text": "分析这张图表的数据趋势"}
            ]
        }]
    }
)

# 第二轮:同一张图继续追问(无需重新上传)
response2 = requests.post(
    f"{BASE_URL}/chat/completions",
    headers={"Authorization": f"Bearer {API_KEY}"},
    json={
        "model": "deepseek-v4-flash-vision-exp",
        "messages": [{
            "role": "user",
            "content": [
                {"type": "file_id", "file_id": file_id},
                {"type": "text", "text": "基于图表的异常数据点,给出排查建议"}
            ]
        }]
    }
)

6.3 Python:工具调用(Tool Calls)+ 视觉理解结合

def multimodal_agent_with_tools():
    """
    多模态Agent:视觉理解 + 工具调用组合
    场景:读取报错截图 -> 搜索解决方案 -> 生成修复代码
    """
    error_screenshot = "./error_screenshot.png"
    file_id = upload_file_to_deepseek(error_screenshot)
    
    # 第一步:识别报错内容
    identify_response = requests.post(
        f"{BASE_URL}/chat/completions",
        headers={"Authorization": f"Bearer {API_KEY}"},
        json={
            "model": "deepseek-v4-flash-vision-exp",
            "messages": [{
                "role": "user",
                "content": [
                    {"type": "file_id", "file_id": file_id},
                    {
                        "type": "text",
                        "text": "请识别这张截图中的错误信息,"
                                "提取错误类型、错误代码和关键堆栈信息"
                    }
                ]
            }],
            "tools": [{
                "type": "function",
                "function": {
                    "name": "search_web",
                    "description": "搜索互联网获取信息",
                    "parameters": {
                        "type": "object",
                        "properties": {
                            "query": {
                                "type": "string",
                                "description": "搜索关键词"
                            }
                        },
                        "required": ["query"]
                    }
                }
            }],
            "tool_choice": "auto"
        }
    )
    
    return identify_response.json()

# 执行多模态Agent
result = multimodal_agent_with_tools()
print(result["choices"][0]["message"]["content"])

6.4 Go:Responses API调用示例

package main

import (
    "bytes"
    "encoding/base64"
    "encoding/json"
    "fmt"
    "io/ioutil"
    "net/http"
)

type VisionRequest struct {
    Model    string        `json:"model"`
    Messages []Message     `json:"messages"`
    MaxTokens int          `json:"max_tokens"`
}

type Message struct {
    Role    string    `json:"role"`
    Content []Content `json:"content"`
}

type Content struct {
    Type     string      `json:"type"`
    Text     string      `json:"text,omitempty"`
    ImageURL *ImageURL   `json:"image_url,omitempty"`
}

type ImageURL struct {
    URL    string `json:"url"`
    Detail string `json:"detail"`
}

func main() {
    apiKey := "sk-your-deepseek-api-key"
    
    // 读取图片并编码
    imgData, _ := ioutil.ReadFile("./chart.png")
    base64Img := base64.StdEncoding.EncodeToString(imgData)
    
    // 构建请求体
    reqBody := VisionRequest{
        Model: "deepseek-v4-flash-vision-exp",
        Messages: []Message{
            {
                Role: "user",
                Content: []Content{
                    {
                        Type: "image_url",
                        ImageURL: &ImageURL{
                            URL:    fmt.Sprintf("data:image/png;base64,%s", base64Img),
                            Detail: "high",
                        },
                    },
                    {
                        Type: "text",
                        Text: "分析这张图表,提取关键数据点和趋势",
                    },
                },
            },
        },
        MaxTokens: 4096,
    }
    
    body, _ := json.Marshal(reqBody)
    
    // 发送请求
    req, _ := http.NewRequest("POST",
        "https://api.deepseek.com/v1/responses",
        bytes.NewBuffer(body))
    req.Header.Set("Authorization", "Bearer "+apiKey)
    req.Header.Set("Content-Type", "application/json")
    
    client := &http.Client{}
    resp, _ := client.Do(req)
    
    var result map[string]interface{}
    json.NewDecoder(resp.Body).Decode(&result)
    
    fmt.Printf("%+v\n", result)
}

6.5 DeepSeek Harness配置:接入Vision-Exp模型

# harness-config.yaml
# DeepSeek Harness 模型配置 - 启用Vision-Exp

models:
  default: deepseek-v4-flash-vision-exp
  
  providers:
    deepseek:
      api_key: ${DEEPSEEK_API_KEY}
      base_url: https://api.deepseek.com/v1
      models:
        - name: deepseek-v4-flash-vision-exp
          multimodal: true  # 启用多模态支持
          max_images: 600   # 单次请求最大图片数
          image_size_limit: 64  # MiB
          supports_files_api: true
          
        - name: deepseek-v4-flash
          multimodal: false  # 纯文本模型
          
        - name: deepseek-v4-pro
          multimodal: false

agent:
  mode: standard  # standard / ptc / minimal / creative
  
  # 视觉Agent配置
  vision:
    default_detail: auto  # low / original / auto
    max_image_tokens: 384  # 单张图片最大Token数
    enable_file_referencing: true  # 启用Files API引用
    auto_compress_large_images: true  # 自动压缩大图
    
  tools:
    - file_editor
    - terminal
    - web_search
    - code_executor
    - image_analysis  # 新增:图片分析工具

七、价格与性价比深度分析

7.1 定价模型

V4-Flash-Vision-Exp的API价格与V4-Flash完全一致,没有因为新增视觉能力而涨价:

┌─────────────────────────────────────────────────────────────────┐
│              V4-Flash-Vision-Exp 定价 (每百万Token)              │
├───────────────┬──────────────────────┬──────────────────────────┤
│    计费项      │   空闲时段             │    高峰时段               │
│               │   (00:00-09:00,       │    (09:00-12:00,         │
│               │    18:00-24:00)       │     14:00-18:00)         │
├───────────────┼──────────────────────┼──────────────────────────┤
│ 输入(缓存命中) │    0.05 元            │     0.10 元              │
│ 输入(缓存未命中)│   1.5 元             │     3.0 元               │
│ 输出           │   4.5 元             │     9.0 元               │
├───────────────┴──────────────────────┴──────────────────────────┤
│                                                                 │
│  图片Token折算规则:                                              │
│  • low模式: 缩放到512×512, 固定Token消耗                          │
│  • original/auto模式: 按实际尺寸折算, 单张最多384 Tokens          │
│  • 一张图片最低成本: 384 × 1.5/1e6 ≈ 0.000576元 (约0.06分钱)    │
│  • 高峰时段: 约0.12分钱/张                                       │
└─────────────────────────────────────────────────────────────────┘

7.2 与竞品价格对比

┌──────────────────┬──────────────┬──────────────┬───────────────┐
│      模型         │ 输入价格      │ 输出价格      │ 视觉附加费     │
│                  │ (每百万Token) │ (每百万Token) │               │
├──────────────────┼──────────────┼──────────────┼───────────────┤
│ DeepSeek V4-     │ 1.5~3元      │ 4.5~9元      │ 无 (图片折算  │
│ Flash-Vision-Exp │ (闲时~高峰)  │ (闲时~高峰)  │ Token统一计费)│
├──────────────────┼──────────────┼──────────────┼───────────────┤
│ GPT-5.6 Sol      │ ~$15/百万    │ ~$60/百万    │ 单独图片计费   │
│ Vision           │ (~105元)     │ (~420元)     │               │
├──────────────────┼──────────────┼──────────────┼───────────────┤
│ Gemini 3.7 Flash │ ~$0.15/百万  │ ~$0.60/百万  │ 按图片尺寸     │
│                  │ (~1.05元)    │ (~4.2元)     │ 额外计费       │
├──────────────────┼──────────────┼──────────────┼───────────────┤
│ Qwen3.8-VL       │ ~¥2/百万     │ ~¥8/百万     │ 无 (统一计费)  │
├──────────────────┼──────────────┼──────────────┼───────────────┤
│ Opus-4.8         │ ~$5/百万     │ ~$55/百万    │ 按图片Token    │
│                  │ (~35元)      │ (~385元)     │ 计费           │
└──────────────────┴──────────────┴──────────────┴───────────────┘

性价比分析

  • 对比Opus-4.8:DeepSeek的输入价格仅为Opus-4.8的约1/23,输出价格约1/43。在多模态Agent能力接近的情况下,价格差距极为显著。
  • 对比GPT-5.6 Sol Vision:DeepSeek的输入价格约为1/70,输出价格约为1/47。对于需要大量视觉Agent调用的场景,成本优势是压倒性的。
  • 对比Gemini 3.7 Flash:Gemini Flash虽然输入价格更低,但输出价格相近,且Gemini对图片有额外的尺寸计费规则。DeepSeek将图片折算为Token统一计费,对开发者更透明。
  • 对比Qwen3.8-VL:价格相近,但DeepSeek在Agent能力上有明显优势。

7.3 峰谷定价策略的深意

DeepSeek于8月13日引入峰谷定价机制(高峰时段价格为闲时的2倍),这在API定价中是一个相对少见的策略。其背后的逻辑是:

  • 引导错峰使用:将非关键任务调度到闲时,降低用户成本的同时也平衡了服务器负载
  • 缓存命中的极致优惠:缓存命中时闲时仅0.05元/百万Token,适合高频重复的视觉任务(如批量分析同类截图)
  • 为大规模Agent部署铺路:对于需要7×24小时运行的生产级Agent,可以通过合理调度将成本控制在极低水平

八、与竞品全面对比

8.1 多模态模型横向对比

┌──────────────────────┬──────────┬────────────┬──────────┬──────────┐
│       维度           │ DeepSeek │ GPT-5.6    │ Gemini   │ Qwen3.8  │
│                     │ V4-Flash │ Sol Vision │ 3.7 Flash │ -VL      │
│                     │ -Vision↵ │            │           │          │
├──────────────────────┼──────────┼────────────┼──────────┼──────────┤
│ 开源                 │  ❌(API) │    ❌      │    ❌     │  ✅(部分) │
│ 上下文窗口           │  1M      │  1M       │  2M      │  128K    │
│ 最大输出长度         │  384K    │  128K     │  64K     │  32K     │
│ 图片格式             │ 4种     │  多种     │  多种    │  多种    │
│ 视频输入             │  ❌      │  ✅       │  ✅      │  ❌      │
│ Agent能力            │  🟢强   │  🟢强     │  🟡中    │  🟡中    │
│ 工具调用             │  ✅      │  ✅       │  ✅      │  ✅      │
│ JSON Output          │  ✅      │  ✅       │  ✅      │  ✅      │
│ Responses API        │  ✅      │  ✅       │  ❌      │  ❌      │
│ Anthropic API兼容    │  ✅      │  ❌       │  ❌      │  ❌      │
│ Files API            │  ✅(免费)│  ✅(收费)  │  ✅(收费) │  ❌      │
│ 价格(输入/输出,元/   │ 1.5~3/   │ ~105/~420 │ ~1.05/   │ ~2/~8    │
│ 百万Token)           │ 4.5~9   │            │ ~4.2     │          │
│ 峰谷定价             │  ✅      │  ❌       │  ❌      │  ❌      │
│ 国产算力适配         │  ✅(昇腾)│  ❌       │  ❌      │  ✅      │
└──────────────────────┴──────────┴────────────┴──────────┴──────────┘

8.2 核心差异化分析

vs GPT-5.6 Sol Vision:GPT-5.6 Sol Vision是OpenAI的最新多模态模型,在综合能力上仍处于领先地位。但DeepSeek的差异化优势在于:

  1. Agent优先设计:Vision Exp从架构上就是为Agent场景设计的,在工具调用、长上下文、多轮交互方面有天然优势
  2. 极致性价比:价格仅为GPT-5.6 Sol Vision的约1/50
  3. API兼容性:同时支持OpenAI Chat Completions、Responses API和Anthropic API三种格式,迁移成本极低

vs Gemini 3.7 Flash:Gemini 3.7 Flash在多模态原生能力(尤其是视频理解)上仍有优势,但在Agent场景中:

  1. 上下文窗口虽大(2M),但Agent任务对工具调用的支持不如DeepSeek深入
  2. 不支持Responses API和Anthropic API格式
  3. 价格在输出端与DeepSeek相近,但输入端的极低价格优势被图片额外计费部分抵消

vs Qwen3.8-VL:Qwen3.8-VL是阿里通义的最新多模态模型,在中文场景有竞争力:

  1. 价格相近,但Qwen的上下文窗口(128K)远小于DeepSeek(1M)
  2. Agent能力差距明显,尤其在复杂工具调用和长任务执行上
  3. DeepSeek的Files API免费策略更具吸引力

8.3 开源生态对比

虽然Vision Exp本身尚未开源(仅通过API提供服务),但DeepSeek Harness的完全开源(MIT协议)为其生态提供了关键支撑。相比之下,GPT-5.6 Sol Vision和Gemini 3.7 Flash均为闭源,开发者无法在框架层面进行深度定制。


九、行业影响与未来展望

9.1 对多模态Agent赛道的影响

V4-Flash-Vision-Exp的发布,标志着开源多模态Agent进入了一个新阶段:

  1. 降低了多模态Agent的准入门槛:在此之前,构建一个能"看"的Agent至少需要组合两个模型(视觉模型+推理模型),现在只需一个API调用。Files API的免费策略进一步降低了存储和带宽成本。

  2. 加速了Agent工具的视觉化演进:随着Harness对视觉能力的原生支持,越来越多的Agent工具将自然融入视觉感知——终端操作可以结合截图理解,代码编辑可以结合UI设计稿,搜索可以结合图片内容。

  3. 推动了"看-思考-行动"闭环的完善:DeepSeek正在构建的不仅是一个视觉模型,而是一套完整的"感知-推理-行动"闭环:

                    DeepSeek多模态Agent闭环
                        
                ┌───────────────┐
                │   感知(Perceive) │
                │  V4-Flash-    │
                │  Vision-Exp   │
                │  图片/截图/图表  │
                └───────┬───────┘
                        │
                        ▼
                ┌───────────────┐
                │   思考(Reason)  │
                │  V4-Flash核心  │
                │  推理引擎       │
                │  1M上下文      │
                └───────┬───────┘
                        │
                        ▼
                ┌───────────────┐
                │   行动(Act)     │
                │  DeepSeek      │
                │  Harness       │
                │  工具/代码/终端  │
                └───────┬───────┘
                        │
                        └─────────► 循环反馈

9.2 潜在局限与待观察问题

  1. 实验性质(Exp后缀):不推荐直接用于生产环境,接口和行为可能调整
  2. 仅支持图片:不支持视频输入,在多模态感知维度上仍有短板
  3. 架构不透明:未公布技术报告,视觉编码器架构、训练方式、参数规模等关键信息缺失
  4. 第三方评测待验证:官方自测数据需要第三方独立评测交叉验证
  5. 纯文本任务中的细微差距:在Cybergym等安全基准上,Vision Exp比V4-Flash低了1.4分,说明视觉能力的加入对某些纯文本任务有轻微影响

9.3 未来展望

基于DeepSeek的产品路线图和行业发展趋势,可以做出以下合理预期:

  1. 正式版(非Exp)的推出:预计在1-2个月内,基于社区反馈迭代后推出正式版,可能伴随技术报告的发布
  2. V4-Pro-Vision的可能性:将视觉能力接入V4-Pro,推出更强的多模态旗舰模型
  3. 视频理解能力的加入:中长期来看,视频理解是必然方向
  4. 模型开源的可能性:参考DeepSeek一贯的开源策略,正式版后开源权重模型存在较大可能
  5. 与Claude Code/Codex的竞争:随着Harness + Vision-Exp的组合成熟,将直接对标Claude Code和OpenAI Codex

十、开发者实践建议

10.1 上手路线图

对于希望快速上手V4-Flash-Vision-Exp的开发者,建议按以下步骤推进:

  1. 环境准备:获取DeepSeek API密钥,确认API账户余额充足(建议至少充值50元用于测试)
  2. 基础调用测试:使用Python SDK或cURL测试单张图片的视觉理解能力,验证模型是否能正确识别你的图片内容
  3. Files API集成:将经常使用的图片上传至Files API,通过file_id复用,观察多轮对话中的图片引用效果
  4. Harness本地部署:安装DeepSeek Harness v0.1.1以上版本,配置Vision-Exp为默认视觉模型,体验图文混合的Agent工作流
  5. 场景化开发:选择你最熟悉的Agent场景(如网页自动化、报错诊断、数据分析等),构建完整的"视觉理解→推理→工具调用"闭环

10.2 最佳实践

  • 图片预处理:对于大尺寸图片(>4K分辨率),建议先压缩再上传,避免不必要的Token消耗。单张图片384 Token的上限意味着超大图片可能被压缩到较低分辨率
  • 缓存策略:对于高频重复的视觉任务(如监控面板截图分析),利用缓存命中机制(空闲时段仅0.05元/百万Token),将任务调度到非高峰时段执行
  • 细节模式选择:简单图标识别用low模式节省Token,图表分析用original模式保留细节,不确定时使用auto让系统自动判断
  • 多图组合:单次请求最多支持600张图片,适合批量截图的对比分析场景,但需注意总Token消耗
  • 错误处理:建议在代码中加入重试逻辑和降级策略(如图片加载失败时回退到纯文本模式)

10.3 需避开的坑

  • Exp版本接口可能变更,重要生产任务请不要直接依赖当前API行为
  • 不支持视频输入,如果需要视频理解,仍需结合其他模型或自行拆分视频帧
  • Files API存储空间有限(25GiB/用户),建议定期清理不再需要的文件,避免存储满导致上传失败
  • 图片的Token折算规则可能在未来调整,建议关注官方文档更新
  • 第三方评测尚未发布,官方自测数据仅供参考,不要以此作为唯一选型依据

十一、总结

DeepSeek V4-Flash-Vision-Exp的发布,与其说是一个"视觉模型"的上线,不如说是DeepSeek多模态Agent基础设施的关键拼图——它让模型、图片、文件、工具和Agent执行链开始连在一起。

核心三点

  1. 文本能力无损:在Agent、推理、世界知识等纯文本能力上与V4-Flash持平,视觉能力的加入没有"拖累"文本推理
  2. 多模态Agent能力跃升:在需要视觉理解的Agent基准上大幅提升,接近Opus-4.8水平
  3. 极致性价比:价格与V4-Flash完全一致,视觉理解成本极低(一张图约0.06分钱),在Agent场景中具有显著的成本优势

对于开发者而言,现在是上手尝试的最佳时机——Exp版本虽然不建议用于生产环境,但正适合在真实场景中探索多模态Agent的可能性,并向DeepSeek反馈使用体验。毕竟,一个"能看见"的开源Agent生态,才刚刚开始。


参考资料:DeepSeek API官方更新日志(api-docs.deepseek.com/updates/)、36氪报道、凤凰网科技、InfoQ、新京报、IT之家、The Next Web