项目介绍
为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode
适合用来做什么
评估前沿 AI 能力
阅读源码与工程实践
用于技术选型调研
为什么值得关注
该项目在 GitHub 保持活跃,并在 AI 工程相关主题中获得持续关注。