OCR文字识别助手

让 AI 看懂你的屏幕:OCR文字识别助手 Skill 安装说明

把 OCR文字识别助手接入支持 Skill 的 AI 工具,让 AI 获得本地视觉入口:读取图片和截图文字,理解当前屏幕、软件界面、报错弹窗、安装向导、聊天截图和网页内容,并辅助判断下一步操作。

这篇说明用于把 OCR文字识别助手 接入支持 Skill 的 AI 工具。安装后,AI 不只是“识别几行文字”,而是可以通过 OCR文字识别助手 获取本机图片、屏幕、窗口或区域的可见内容,把原本看不到的本地界面转换成可分析的上下文。 这相当于给 AI 增加一个本地视觉入口:当你问“当前窗口在干嘛”“这个报错什么意思”“安装卡在哪一步”“下一步点哪里”“帮我看下这张聊天截图/软件界面/网页/终端输出”时,AI 可以主动调用 OCR文字识别助手截图、识别文字,并结合截图内容给出判断。 ## 它能帮 AI 看懂什么 - 本地图片、聊天截图、网页截图、报表截图中的文字和结构 - 当前屏幕、前台窗口、当前显示器或指定区域中的可见内容 - 软件界面、IDE、终端、控制台、安装向导、登录页、设置页和错误弹窗 - 按钮、菜单、进度提示、选中状态、表格、代码片段和操作提示 - 当前界面正在做什么、是否报错、卡在哪一步,以及下一步应该点哪里或检查什么 ## 为什么需要这个 Skill 普通 AI 工具通常只能处理你复制给它的文字,无法直接看到你电脑上的窗口、弹窗、安装进度或截图细节。OCR文字识别助手 Skill 的作用,是在你授权的本机环境里,把这些可见内容转换成 AI 可以理解和分析的信息。 因此它适合这些场景:安装软件时不知道下一步怎么选;程序报错但不想手动复制长日志;聊天截图、表格截图、网页截图需要整理;IDE 或终端里出现提示但你不确定含义;远程协助时希望 AI 先看一眼当前屏幕再给建议。 ## 使用前提 1. 已安装 OCR文字识别助手 桌面版;如果未安装,Skill 可在 AI 工具中引导从固定地址下载安装。 2. Skill 发布地址使用: `https://ocr.oldfish.cn/skill/ocr.md` 3. 安装 Skill 后,重启对应的 AI 工具。 ## 一键安装 ### Codex `cmd /d /c curl.exe -L --create-dirs https://ocr.oldfish.cn/skill/ocr.md -o "%USERPROFILE%/.codex/skills/ocr-assistant/SKILL.md"` ### Claude Code `cmd /d /c curl.exe -L --create-dirs https://ocr.oldfish.cn/skill/ocr.md -o "%USERPROFILE%/.claude/skills/ocr-assistant/SKILL.md"` ### Gemini CLI `cmd /d /c curl.exe -L --create-dirs https://ocr.oldfish.cn/skill/ocr.md -o "%USERPROFILE%/.gemini/skills/ocr-assistant/SKILL.md"` ### Google Antigravity `cmd /d /c curl.exe -L --create-dirs https://ocr.oldfish.cn/skill/ocr.md -o "%USERPROFILE%/.gemini/antigravity/skills/ocr-assistant/SKILL.md"` ### Kiro `cmd /d /c curl.exe -L --create-dirs https://ocr.oldfish.cn/skill/ocr.md -o "%USERPROFILE%/.kiro/skills/ocr-assistant/SKILL.md"` ### CodeBuddy `cmd /d /c curl.exe -L --create-dirs https://ocr.oldfish.cn/skill/ocr.md -o "%USERPROFILE%/.codebuddy/skills/ocr-assistant/SKILL.md"` ### OpenClaw `cmd /d /c curl.exe -L --create-dirs https://ocr.oldfish.cn/skill/ocr.md -o "%USERPROFILE%/.openclaw/skills/ocr-assistant/SKILL.md"` ### OpenCode `cmd /d /c curl.exe -L --create-dirs https://ocr.oldfish.cn/skill/ocr.md -o "%USERPROFILE%/.config/opencode/skills/ocr-assistant/SKILL.md"` ### 项目级安装 `cmd /d /c curl.exe -L --create-dirs https://ocr.oldfish.cn/skill/ocr.md -o ".agents/skills/ocr-assistant/SKILL.md"` ## 安装后可以这样问 AI - 看下当前窗口在干嘛,下一步该怎么操作 - 帮我读一下这张聊天截图,整理重点 - 当前安装界面卡在哪一步?我应该点哪个按钮? - 这个报错弹窗是什么意思,应该怎么处理? - 截取屏幕并识别里面的文字 - 看下终端/IDE 里的提示,判断是否执行成功 - 截取左上角 400x300 区域,看看里面有什么 - 帮我识别这个网页截图里的表格内容 ## 这个 Skill 的设计原则 - 把本机图片、屏幕和窗口内容变成 AI 可分析的上下文 - 自动定位已安装的 OCR文字识别助手,不依赖源码目录、csproj、开发环境或固定安装路径 - 不要求用户配置环境变量 - 优先使用非交互截图,减少打断用户当前操作 - 优先复用已经运行的主进程,兼容热启动和冷启动 - 安装、下载和运行安装器属于系统变更,会在用户确认后再执行 ## 能力边界 - 文件识别当前只支持图片格式:png、jpg、jpeg、bmp、gif - 文字识别、截图和界面理解是核心能力,不包含翻译能力 - `fast` 和 `edit` 属于需要人工参与的交互截图 - 当前窗口和当前显示器识别依赖系统前台窗口状态;无法确认前台窗口时,Skill 会优先使用全屏截图作为更稳妥的上下文
OCR助手QQ在线客服
QQ客服(365833440)
OCR助手QQ用户交流群
QQ群(100029010)
OCR助手邮件联系客服
邮箱:net10010@qq.com

感谢您的意见和建议!