dsh-plugin-verified-search
f0909172434
Verified current-source search workflow for DeepSeek Harness
PROJECT TOPICS
PROJECT README
给纯文本模型(如 deepseek-v4-flash)的"读图"能力——双版本发布:
- DSH 版:DeepSeek Harness 插件(
dsh-plugin,含 DSH EAC 桌面端)- ZCode 版:ZCode 桌面端插件(
zcode-plugin,经 MCP 暴露工具)
把图片 降分辨率 + 降色深 + 结构/色彩指纹提取,渲染成文本网格喂回对话, 让模型像多模态模型一样"看"图:描述场景、主体、环境、光线与语义内容。 纯本地、零外部模型依赖、零 API key、零 Python(PaddleOCR 为可选增强)。
| 版本 | 平台 | 形态 | 源码 | 安装 |
|---|---|---|---|---|
| DSH 版 | DeepSeek Harness(含 EAC 桌面端) | npm 插件(dsh.bundle) |
仓库根目录 | dsh plugin --profile web add picturereader |
| ZCode 版 | ZCode 桌面端 | 本地 marketplace 插件(MCP server + skill) | zcode/ 子目录 |
Settings → Plugin Management → Discover → 本地目录 |
两个版本共用同一套业务核心(src/core.js)与读图方法论 skill(image-reading),
三个工具行为完全一致:image_scan / image_ocr / image_sample。
ZCode 版性能说明:ZCode 版通过 MCP(stdio 子进程)暴露工具,每次调用都要 经历进程通信与序列化开销,速度明显慢于 DSH 版(DSH 版为插件内直接调用)。 高频看图、批量看图任务请优先使用 DSH 版;ZCode 版适合轻量、偶发看图。
DeepSeek 等纯文本模型没有视觉编码器,无法直接看图。picturereader 把"看图"翻译成模型能理解的结构化文本证据,并提供一套经过大量真实图片迭代验证的读图方法论 skill(image-reading),让模型像人一样分步看图:
| 工具 | 作用 |
|---|---|
image_scan |
全局/区域扫描:亮度/颜色网格 + regions 色块 + shade diversity + texture mix + structure(条纹/对称) + 像素级 colors + hue families 纯色指纹;支持 focus/region 局部放大、px_per_cell 像素密度定向放大 |
image_ocr |
文字识别双引擎:windows(内置,默认)/ paddle(选装,发光/弯曲/游戏字更强),失败自动降级不崩溃 |
image_sample |
8×8 精确像素取样,判断材质/纹理(金属/木纹/织物/皮肤/噪点) |
skills/image-reading.md(DSH 版)/ skills/image-reading/SKILL.md(ZCode 版)是一套经大量真实图片场景迭代验证的读图方法论
(按 experience / skill / principle / insight 分层,教训有据可依、找得到主模型模式),
安装后模型自动掌握:
# 1. 插件
dsh plugin --profile web add picturereader # 或从源码: dsh plugin --profile web add .
dsh plugin --profile headless add picturereader
# 2. 读图方法论 skill(推荐)
copy skills\image-reading.md %USERPROFILE%\.dsh\skills\ # Windows
# macOS/Linux: cp skills/image-reading.md ~/.dsh/skills/
# 3.(可选)PaddleOCR 增强引擎:node scripts/setup-ocr.mjs
重启 DSH Desktop 后,模型工具列表出现 image_scan / image_ocr / image_sample,
技能目录出现 image-reading。
ZCode 版源码在本仓库 zcode/ 子目录(本地开发目录为 D:\coding\picturereader_zcode)。
ZCode 桌面端 → Settings → Plugin Management → Discover → "+" → 本地目录
→ 选择 zcode/ 目录(或本地开发目录 picturereader_zcode)
→ 市场列表出现 picturereader → 安装
安装并启用后(重启 ZCode 或按提示重连):
picturereader 自动连接(stdio 子进程 node mcp/server.js),模型工具列表出现 image_scan / image_ocr / image_sample;image-reading 自动出现在技能列表(图片任务自动触发);node scripts/setup-ocr.mjs。关于安装后的运行位置:市场安装会把插件目录拷贝到 ZCode 插件缓存 (
~/.zcode/cli/plugins/cache/...),但.zcode-plugin/plugin.json里 MCP server 的args是具体绝对路径,指向所选目录的mcp/server.js——因此 MCP server 始终从 所选目录运行:改src/core.js下次调用即生效(热加载)。skill / 工具定义变更 需在 Discover 里卸载后重装生效(或手动同步缓存副本)。若插件目录移动,请同步更新plugin.json里的args路径。
直接对模型说:
用 image_scan 看一下 <路径> 这张图,细看感兴趣的部分
模型会加载 image-reading 方法论自动执行完整流程(定调 → 找主体 → 验证 → 描述)。
image: chart.png (600x400 -> 32x21 cells, ~18.8x19px per cell, region=full, palette=full, mode=color)
shade diversity: 10 distinct shades | texture: smooth 24.2%, medium 19.3%, rough 56.5%
structure: 6 vertical stripes (4 alternating colors) at cols 4..7; left-right symmetry 45%
hue families: cyan 88.2%, green 4.5%, yellow 1% ← 真实主调(colors 灰白占比是假象)
regions: ...(色块结构)
colors by area: ...(像素级真实占比)
luminance grid / color grid
| 变量 | 默认值 | 作用 |
|---|---|---|
DSH_PADDLE_PYTHON |
C:\Users\Administrator\paddle_venv\Scripts\python.exe |
PaddleOCR 解释器路径(与原插件同名,便于直接迁移) |
DSH_PADDLE_CACHE |
<插件目录>\.paddlex-cache |
PaddleX 模型缓存目录 |
# DSH 版(仓库根目录)
npm install
npm test # node:test,76 个测试全绿
node scripts/setup-ocr.mjs # 可选:装 PaddleOCR
node scripts/preview.mjs # 生成 fixtures 并预览渲染
# ZCode 版(zcode/ 子目录)
cd zcode
npm install
npm test # node:test
node scripts/setup-ocr.mjs # 可选
热插拔(DSH 版):DSH 本身不支持代码热重载,但本插件自带执行层热加载——业务逻辑全在
src/core.js 单文件,工具每次执行按 mtime 动态加载(cache-bust),改 core.js
下次调用即生效;工具定义(schema/描述)改动需重启桌面端。
热插拔(ZCode 版):MCP server 从所选目录运行,改 src/core.js 下次调用即生效
(见上"安装后运行位置")。
scripts/setup-ocr.mjs),缺失自动降级不崩溃MIT
CLASSIFICATION EVIDENCE
系统优先读取 GitHub Topics,再与站内分类词典和词根规则比对。