让 AI 看懂你的屏幕:OCR文字识别助手 Skill 安装说明
📅
发布时间:2026年05月08日
👁️
阅读量:368
⏱️
约 14 分钟 (2783 字)
把 OCR文字识别助手接入支持 Skill 的 AI 工具,让 AI 获得本地视觉入口:读取图片和截图文字,理解当前屏幕、软件界面、报错弹窗、安装向导、聊天截图和网页内容,并辅助判断下一步操作。
这篇说明用于把 OCR文字识别助手 接入支持 Skill 的 AI 工具。安装后,AI 不只是“识别几行文字”,而是可以通过 OCR文字识别助手 获取本机图片、屏幕、窗口或区域的可见内容,把原本看不到的本地界面转换成可分析的上下文。
这相当于给 AI 增加一个本地视觉入口:当你问“当前窗口在干嘛”“这个报错什么意思”“安装卡在哪一步”“下一步点哪里”“帮我看下这张聊天截图/软件界面/网页/终端输出”时,AI 可以主动调用 OCR文字识别助手截图、识别文字,并结合截图内容给出判断。
## 它能帮 AI 看懂什么
- 本地图片、聊天截图、网页截图、报表截图中的文字和结构
- 当前屏幕、前台窗口、当前显示器或指定区域中的可见内容
- 软件界面、IDE、终端、控制台、安装向导、登录页、设置页和错误弹窗
- 按钮、菜单、进度提示、选中状态、表格、代码片段和操作提示
- 当前界面正在做什么、是否报错、卡在哪一步,以及下一步应该点哪里或检查什么
## 为什么需要这个 Skill
普通 AI 工具通常只能处理你复制给它的文字,无法直接看到你电脑上的窗口、弹窗、安装进度或截图细节。OCR文字识别助手 Skill 的作用,是在你授权的本机环境里,把这些可见内容转换成 AI 可以理解和分析的信息。
因此它适合这些场景:安装软件时不知道下一步怎么选;程序报错但不想手动复制长日志;聊天截图、表格截图、网页截图需要整理;IDE 或终端里出现提示但你不确定含义;远程协助时希望 AI 先看一眼当前屏幕再给建议。
## 使用前提
1. 已安装 OCR文字识别助手 桌面版;如果未安装,Skill 可在 AI 工具中引导从固定地址下载安装。
2. Skill 发布地址使用:
`https://ocr.oldfish.cn/skill/ocr.md`
3. 安装 Skill 后,重启对应的 AI 工具。
## 一键安装
### Codex
`cmd /d /c curl.exe -L --create-dirs https://ocr.oldfish.cn/skill/ocr.md -o "%USERPROFILE%/.codex/skills/ocr-assistant/SKILL.md"`
### Claude Code
`cmd /d /c curl.exe -L --create-dirs https://ocr.oldfish.cn/skill/ocr.md -o "%USERPROFILE%/.claude/skills/ocr-assistant/SKILL.md"`
### Gemini CLI
`cmd /d /c curl.exe -L --create-dirs https://ocr.oldfish.cn/skill/ocr.md -o "%USERPROFILE%/.gemini/skills/ocr-assistant/SKILL.md"`
### Google Antigravity
`cmd /d /c curl.exe -L --create-dirs https://ocr.oldfish.cn/skill/ocr.md -o "%USERPROFILE%/.gemini/antigravity/skills/ocr-assistant/SKILL.md"`
### Kiro
`cmd /d /c curl.exe -L --create-dirs https://ocr.oldfish.cn/skill/ocr.md -o "%USERPROFILE%/.kiro/skills/ocr-assistant/SKILL.md"`
### CodeBuddy
`cmd /d /c curl.exe -L --create-dirs https://ocr.oldfish.cn/skill/ocr.md -o "%USERPROFILE%/.codebuddy/skills/ocr-assistant/SKILL.md"`
### OpenClaw
`cmd /d /c curl.exe -L --create-dirs https://ocr.oldfish.cn/skill/ocr.md -o "%USERPROFILE%/.openclaw/skills/ocr-assistant/SKILL.md"`
### OpenCode
`cmd /d /c curl.exe -L --create-dirs https://ocr.oldfish.cn/skill/ocr.md -o "%USERPROFILE%/.config/opencode/skills/ocr-assistant/SKILL.md"`
### 项目级安装
`cmd /d /c curl.exe -L --create-dirs https://ocr.oldfish.cn/skill/ocr.md -o ".agents/skills/ocr-assistant/SKILL.md"`
## 安装后可以这样问 AI
- 看下当前窗口在干嘛,下一步该怎么操作
- 帮我读一下这张聊天截图,整理重点
- 当前安装界面卡在哪一步?我应该点哪个按钮?
- 这个报错弹窗是什么意思,应该怎么处理?
- 截取屏幕并识别里面的文字
- 看下终端/IDE 里的提示,判断是否执行成功
- 截取左上角 400x300 区域,看看里面有什么
- 帮我识别这个网页截图里的表格内容
## 这个 Skill 的设计原则
- 把本机图片、屏幕和窗口内容变成 AI 可分析的上下文
- 自动定位已安装的 OCR文字识别助手,不依赖源码目录、csproj、开发环境或固定安装路径
- 不要求用户配置环境变量
- 优先使用非交互截图,减少打断用户当前操作
- 优先复用已经运行的主进程,兼容热启动和冷启动
- 安装、下载和运行安装器属于系统变更,会在用户确认后再执行
## 能力边界
- 文件识别当前只支持图片格式:png、jpg、jpeg、bmp、gif
- 文字识别、截图和界面理解是核心能力,不包含翻译能力
- `fast` 和 `edit` 属于需要人工参与的交互截图
- 当前窗口和当前显示器识别依赖系统前台窗口状态;无法确认前台窗口时,Skill 会优先使用全屏截图作为更稳妥的上下文
标签:
OCR文字识别助手
AI视觉能力
本地视觉
Skill安装
AI看屏幕
截图识别
界面理解
图片OCR
Claude Code
Codex
Gemini CLI