dsh-web-speech-input
leozou320-ai
Voice-to-text for the DeepSeek Harness Web UI — live, editable, never auto-sends. | DeepSeek Harness 网页语音输入
PROJECT TOPICS
PROJECT README
一只住在 DeepSeek Harness Web 界面里的桌面宠物:待机呼吸、随机动作(含打瞌睡)、偶尔转向、屏幕漫游、点击反应、可拖拽。
这不是一个普通插件,而是完整的三件套项目:
① 提示词(配方) → ② 素材生成链(引擎) → ③ 插件(成品)
AI 生成动画的配方 源视频 → 透明动画的管线 运行在 DSH 里的宠物
任何人 clone 本仓库,都可以从零生成自己的桌面宠物——换角色、换动作、换风格,全流程可复现。
dsh plugin --profile web add dsh-pet
重启 dsh web,宠物出现在右下角。
用 AI 视频生成工具(如可灵、Runway、豆包等,本项目素材即由豆包生成),按 prompts/桌面宠物 10 秒动作提示词.md 的配方生成 41 个 10 秒绿幕视频:
生成结果放入 video/(41 个 mp4)。
cd scripts
python watermark_step01.py # 水印遮罩填充 → step01/
python chroma_step02.py # 绿幕抠像转透明(HSV 色相)→ step02/
python normalize_step03.py # 归一化 2160×1215 统一站立居中 → step03/
python encode_thumbs.py # 转码 640×360 播放变体 → step04/
依赖:Python 3 + ffmpeg + numpy + scipy(素材链脚本自动用工作区 .tools/ 下的 ffmpeg)。
# 把 step04 的播放变体同步进插件包
cp step04/*.webm dsh-pet/assets/thumb/
# 本地安装插件
dsh plugin --profile web add file:D:/path/to/dsh-pet
中间产物(step01-04)由脚本生成、不入仓库;
video/源视频和脚本是成果、入库维护。
├── prompts/ # ① 41 个动作的生成提示词(绿幕规范 + 按秒分解)
├── scripts/ # ② 素材生成链(7 个 Python 脚本)
├── video/ # ② 源视频(41 个绿幕 mp4 + 水印 mask)
├── tools/ # 开发工具:preview.html(素材链各阶段效果预览)
├── dsh-pet/ # ③ 插件(可独立 npm 发布)
│ ├── lib/index.js # host 半侧:/pet 视频路由
│ ├── lib/client.js # 浏览器半侧:动画链 + 双缓冲播放
│ └── assets/thumb/ # 640×360 播放动画(41 个,~28MB)
├── DESIGN.md # 设计与实现文档(含踩坑记录)
└── LICENSE # MIT
宠物实际运行在 DSH Web 界面中的样子:
全部 41 个动画(640×360,插件实际播放用的资源)——GitHub 只对仓库内图片渲染内联预览,故此处用 GIF 演示;完整透明视频见 dsh-pet/assets/thumb/:
待机 / 转向
移动
动作
点击回应
拖拽
注:动画为透明背景;GIF 预览中透明部分显示为页面底色,实际 webm 播放为透明。
CLASSIFICATION EVIDENCE
系统优先读取 GitHub Topics,再与站内分类词典和词根规则比对。