首页行业百科DeepSeek V4-Flash-Vision-Exp 怎么配置?API 与 Agent 接入教程

DeepSeek V4-Flash-Vision-Exp 怎么配置?API 与 Agent 接入教程

2026-08-22 13:50:19阅读 4

DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek 2026 年 8 月推出的多模态视觉模型,支持输入图片。配置它不算复杂,但有一个关键点:视觉能力不会自动生效,需要手动声明。本文以 DeepSeek Harness(dsh)环境为例,讲清楚怎么配置这个模型、让 Agent 能用上它的读图能力。

DeepSeek V4-Flash-Vision-Exp 怎么配置?API 与 Agent 接入教程_图1

一、先说核心:视觉能力要"声明"才生效

官方文档明确:手动录入的模型,在声明支持图片之前,一律按纯文本对待

也就是说,即使你接入了视觉模型,如果不做配置,给这个模型发图片也会被拒绝。这是 dsh 的保守默认——框架无法自动询问每个端点接受哪些输入。

二、配置方法:声明图片输入

给视觉模型加一行声明,编辑 $DSH_HOME/settings.yaml(默认 ~/.dsh 下):

llm-pi-ai:
  providers:
    deepseek:
      apiKeyEnv: DEEPSEEK_API_KEY
      api: openai-completions
      baseURL: https://api.deepseek.com/v1
      models:
        - id: deepseek-v4-flash-vision-exp   # 视觉模型
          input: [text, image]                 # 声明支持文字+图片

关键点:

  • input: [text, image] 表示该模型接受文字和图片两种输入
  • 声明只作用于单个模型
  • 一条路由可同时服务纯文本和视觉模型(不声明就按纯文本)

三、如果多个模型都支持图片:用默认值

如果手动录入的模型全都支持图片,可以设一次路由级默认值,不用逐个写:

llm-pi-ai:
  providers:
    deepseek:
      apiKeyEnv: DEEPSEEK_API_KEY
      api: openai-completions
      baseURL: https://api.deepseek.com/v1
      defaultInput: [text, image]             # 路由级默认
      models:
        - id: deepseek-v4-flash-vision-exp

四、配置后怎么用

配置生效后,在 dsh 里就可以给模型发图片了:

  • 在对话里附加图片(截图、文档、图表)
  • 模型会"读懂"图片内容并返回文字结论
  • Agent 可以据此执行任务(分析截图、识别文档、看屏幕)

验证方法:发一张带内容的图片,问"这张图里有什么",它能准确回答就说明配置成功。

五、一个重要的坑:声明 ≠ 检查

input 字段是对端点能力的声明(断言)不是检查

  • 你声明了支持图片,但端点实际不支持 → 请求会被提供方拒绝
  • 此时需移除该模型的 image 声明,并开启新会话(附加的图片会留在会话日志里,不换会话会反复重试)

六、常见问题速查

现象处理
发图片被拒未声明图片模态,加 input: [text, image]
加了声明仍被拒端点实际不支持图片,移除声明并开新会话
配置没生效确认写入 $DSH_HOME/settings.yaml,且重启相关会话
想用但没 Key到 DeepSeek 开放平台申请 API Key

七、API 直接调用(不通过 dsh)

如果你只是想在代码里直接用 Vision-Exp,不走 dsh,同样要在请求里带上图片输入(多模态格式),具体字段以 DeepSeek API 文档为准。

总结

DeepSeek V4-Flash-Vision-Exp 配置的核心就一步:在模型配置里声明它支持图片(input: [text, image]。在 dsh 中编辑 $DSH_HOME/settings.yaml 加上这行即可,多个视觉模型可设路由级 defaultInput。配置后 Agent 就能看图了。记住两个关键点:视觉能力要声明才生效;声明是断言不是检查——这两点理解清楚,配置基本不会踩坑。

立即领取行业头部企业 AI 应用案例

资深 AI Agent 技术专家将为您定制数字员工解决方案

立即获取方案