DeepSeek V4-Flash-Vision-Exp 怎么配置?API 与 Agent 接入教程
2026-08-22 13:50:19阅读 4
DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek 2026 年 8 月推出的多模态视觉模型,支持输入图片。配置它不算复杂,但有一个关键点:视觉能力不会自动生效,需要手动声明。本文以 DeepSeek Harness(dsh)环境为例,讲清楚怎么配置这个模型、让 Agent 能用上它的读图能力。
一、先说核心:视觉能力要"声明"才生效
官方文档明确:手动录入的模型,在声明支持图片之前,一律按纯文本对待。
也就是说,即使你接入了视觉模型,如果不做配置,给这个模型发图片也会被拒绝。这是 dsh 的保守默认——框架无法自动询问每个端点接受哪些输入。
二、配置方法:声明图片输入
给视觉模型加一行声明,编辑 $DSH_HOME/settings.yaml(默认 ~/.dsh 下):
llm-pi-ai:
providers:
deepseek:
apiKeyEnv: DEEPSEEK_API_KEY
api: openai-completions
baseURL: https://api.deepseek.com/v1
models:
- id: deepseek-v4-flash-vision-exp # 视觉模型
input: [text, image] # 声明支持文字+图片关键点:
input: [text, image]表示该模型接受文字和图片两种输入- 声明只作用于单个模型
- 一条路由可同时服务纯文本和视觉模型(不声明就按纯文本)
三、如果多个模型都支持图片:用默认值
如果手动录入的模型全都支持图片,可以设一次路由级默认值,不用逐个写:
llm-pi-ai:
providers:
deepseek:
apiKeyEnv: DEEPSEEK_API_KEY
api: openai-completions
baseURL: https://api.deepseek.com/v1
defaultInput: [text, image] # 路由级默认
models:
- id: deepseek-v4-flash-vision-exp四、配置后怎么用
配置生效后,在 dsh 里就可以给模型发图片了:
- 在对话里附加图片(截图、文档、图表)
- 模型会"读懂"图片内容并返回文字结论
- Agent 可以据此执行任务(分析截图、识别文档、看屏幕)
验证方法:发一张带内容的图片,问"这张图里有什么",它能准确回答就说明配置成功。
五、一个重要的坑:声明 ≠ 检查
input 字段是对端点能力的声明(断言),不是检查:
- 你声明了支持图片,但端点实际不支持 → 请求会被提供方拒绝
- 此时需移除该模型的 image 声明,并开启新会话(附加的图片会留在会话日志里,不换会话会反复重试)
六、常见问题速查
| 现象 | 处理 | |||
|---|---|---|---|---|
| 发图片被拒 | 未声明图片模态,加 input: [text, image] | |||
| 加了声明仍被拒 | 端点实际不支持图片,移除声明并开新会话 | |||
| 配置没生效 | 确认写入 $DSH_HOME/settings.yaml,且重启相关会话 | |||
| 想用但没 Key | 到 DeepSeek 开放平台申请 API Key |
七、API 直接调用(不通过 dsh)
如果你只是想在代码里直接用 Vision-Exp,不走 dsh,同样要在请求里带上图片输入(多模态格式),具体字段以 DeepSeek API 文档为准。
总结
DeepSeek V4-Flash-Vision-Exp 配置的核心就一步:在模型配置里声明它支持图片(input: [text, image])。在 dsh 中编辑 $DSH_HOME/settings.yaml 加上这行即可,多个视觉模型可设路由级 defaultInput。配置后 Agent 就能看图了。记住两个关键点:视觉能力要声明才生效;声明是断言不是检查——这两点理解清楚,配置基本不会踩坑。



