dsh-vision-proxy
DeepSeek 大脑 + 自动识图:GUI 附加的每张图片自动经官方 deepseek-v4-flash-vision-exp 原生识图转译,再交给纯文本的 DeepSeek 作答(纯文本 V4-Pro 也能看图);支持任意 OpenAI 兼容 VLM 与本地 Ollama 作为备选。
DeepSeek brain + automatic image transcription: attach images in the GUI and each one is transcribed via the official deepseek-v4-flash-vision-exp by default (a pure-text V4-Pro brain can see images), with any OpenAI-compatible VLM or local Ollama as alternatives.
怎么安装
dsh plugin add dsh-vision-proxy 简介
dsh-vision-proxy English | 简体中文 **保持 DeepSeek 作为对话大脑,图片照样直接发。** 为 DeepSeek Harness 打造:GUI 附加图片自动转译,纯文本 DeepSeek 也能识图。 为什么需要它 DeepSeek Harness 原生按模型声明的 inputModalities 决定是否放行图片附件。DeepSeek 的 chat-completions 线路是纯文本的,所以选中 DeepSeek 时附加图片会被原生拒绝。已有的视觉插件提供 view_image 等*工具*(适用于文件路径),但 **GUI 图片附件对纯文本模型依然失败**。 本插件补上这个缺口:注册一条新提供商路由(deepseek-vision),包装真正的 DeepSeek 适配器——对外声明支持图片输入(附件预检放行),并在请求流里**把每张附加图片转译成文字**后再委托给 DeepSeek。对话仍然由 DeepSeek 作答,识图只是附加能力。 用户附加图片 ──▶ deepseek-vision 路由 ──▶ 经 VLM 转译(OCR+版式+细节) │ │ ▼ ▼ DeepSeek 作答 ◀── 纯文本对话(图片已替换为 [图片转译] 文字) 特性 **绝不卡死**。匿名端点强制 20 秒超时上限(免费档挂起也拖不住整轮对话);匿名端点遇到 HTTP…
推荐参考
信息
- 协议
- MIT
- 语言
- JavaScript
- GitHub 星标
- 14
- 月下载
- 5.8K
- 最近更新
- 2026-08-26
- 创建于
- 2026-08-13
基础安全检查
- 检查结果
- package.json 含 postinstall 脚本
- 收录来源
- curated:awesome-dsh-plugin.com, curated:awesome-dsh-plugin/awesome-dsh-plugin, curated:0xsline/awesome-deepseek-harness
- 主题标签
- dashscope, deepseek-harness, dsh-plugin, image-understanding, multimodal, ocr, qwen, vision, vlm
同类推荐
modlens
liustack/modlens
为纯文本模型架起视觉桥梁:粘贴图片,输出结构化 JSON 证据(OCR、版面、语义)。
dsh-web
zhu1090093659/dsh-web-ui/tree/main/packages/dsh-tool-describe-image
给纯文本模型补视觉:describe_image 把本地路径/URL/附件图片交给可配置的 OpenAI 兼容视觉端点,进会话的只有返回文本。
dsh-vision-router
ysr666/dsh-vision-router
为纯文本 Agent 提供视觉能力:内置免 Key 视觉链 + 像素级视觉工具(看图问答、定位、裁剪、像素对比、取色、OCR、矢量化、抠图、截图);粘贴图片即可用。
dsh-vision-toolkit
Anionex/dsh-vision-toolkit
让纯文本模型处理视觉任务:粘贴图片后自动切换到 Vision Toolkit 变体,支持图片问答、多图比较、长截图 OCR、截图还原前端 UI、元素定位与像素对比。默认无需 API Key——图片经作者自建的免费服务处理,每台机器每天 100 张;也可改为指向自己的服务商。