Набор инструментов, который даёт текстовым ИИ-моделям без встроенного зрения возможность понимать изображения и интерфейсы.
Agent-vision-toolkit добавляет текстовым моделям (например DeepSeek) распознавание изображений, длинных скриншотов, восстановление вёрстки интерфейса по картинке и автоматизацию графического интерфейса. Набор состоит из CLI-утилит, которые агент вызывает через командную строку, и опционального прозрачного прокси для интеграции с Codex, Claude Code и другими агентами.
Описание автора:为纯文本模型"看图“设计更好的视觉工具箱和技能,支持多图理解,图片问答,前端UI还原、GUI 自动化等,并可选无缝接入多个主流agent,直接识别粘贴图片| A vision toolkit and skill designed for text-only llms — image Q&A, long-screenshot OCR, frontend UI restoration, and GUI automation, with optional seamless integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode