Задача: Исследовать локальную генерацию изображений через ComfyUI для AI-агентов
Исследовать локальную генерацию изображений через ComfyUI для AI-агентов
Проверить, можно ли вынести генерацию изображений из Codex/ChatGPT в локальный ComfyUI, оставив агенту постановку задачи, промпты и vision-проверку, чтобы снизить расход токенов и зависания при работе с изображениями.
Контекст
При работе в локальном Codex по подписке регулярно наблюдается проблема со стабильностью длинных чатов, особенно когда агент начинает активно работать с изображениями и макетами.
Практическое наблюдение:
«Кодекс тоже навайбкоденный. Постоянно зависают чаты. Если встал колом, то всё. И ни ошибок, ничего. Просто долгое ожидание, потом реконнект. Начинаешь новый чат — и он уже идёт. Пока опять не зависнет».
И отдельно:
«Как только с картинками начинает работать, прям быстро зависает».
Помимо зависаний, генерация/обработка изображений внутри AI-сессии заметно расходует контекст/токены и может делать итеративную работу над дизайном дорогой и нестабильной.
Гипотеза
Разделить reasoning/vision и непосредственную генерацию изображения.
AI-агент оставить ответственным за:
- понимание задачи и UI/visual requirements;
- подготовку и уточнение prompt;
- выбор параметров/вариантов генерации;
- анализ полученных изображений через vision;
- сравнение с требованиями/референсами;
- формирование следующей итерации;
- принятие решения о достаточности результата.
Саму тяжёлую генерацию выполнять локально через ComfyUI и подходящие локальные image models/workflows.
Предполагаемый цикл:
requirements / текущий UI
↓
AI agent
↓
prompt + generation parameters
↓
local ComfyUI
↓
image(s)
↓
AI vision review
↓
коррекция prompt / параметров
↺
То есть использовать дорогую multimodal модель прежде всего там, где она наиболее полезна: для постановки задачи, reasoning и проверки результата, а массовую генерацию пикселей вынести в специализированный локальный pipeline.
Что исследовать
- Поднять воспроизводимый локальный ComfyUI.
- Подобрать минимальный набор моделей/workflows для UI mockups, illustrations и других типичных визуальных задач разработки.
- Определить простой программный интерфейс, через который coding agent сможет запускать workflow и получать результаты без ручной работы в UI ComfyUI.
- Проверить, может ли агент самостоятельно выполнять цикл
prompt → generate → inspect → adjust → generate. - Проверить работу с несколькими кандидатами и выбором лучшего результата.
- Определить, какие промежуточные данные действительно нужно возвращать в AI-контекст, а какие можно хранить локально, чтобы не раздувать сессию.
- Исследовать, можно ли изолировать image-generation workflow от основного coding-чата, чтобы визуальные итерации не ухудшали стабильность основного контекста.
- Зафиксировать реальные failure modes: зависание ComfyUI, нехватка VRAM/RAM, долгие generation jobs, некорректный prompt, проблемы vision-review, накопление файлов и т.п.
Сравнить с текущим workflow
Провести несколько одинаковых визуальных задач двумя способами:
A. Текущий подход
AI/Codex/ChatGPT самостоятельно работает с генерацией изображений внутри своей multimodal-сессии.
B. Локальный pipeline
AI формирует задание и проверяет результат, а генерация выполняется ComfyUI.
Для каждого сценария фиксировать:
- wall-clock time до приемлемого результата;
- количество итераций;
- расход токенов/контекста, насколько его можно измерить;
- стабильность основной AI-сессии;
- количество зависаний/reconnect/restart;
- качество итогового результата;
- объём ручного участия человека;
- локальные GPU/VRAM/RAM затраты;
- насколько легко агенту самостоятельно диагностировать неудачную генерацию.
Критерий результата
Получить работающий экспериментальный pipeline, в котором coding agent может вызвать локальный ComfyUI, получить изображение, самостоятельно визуально проверить его и при необходимости запустить следующую итерацию.
После нескольких реальных задач ответить на вопросы:
- снижает ли это расход AI-контекста/токенов;
- становится ли coding-чат стабильнее;
- ускоряется или замедляется полный цикл до приемлемого результата;
- достаточно ли качества локальных моделей для реальной продуктовой работы;
- какие типы визуальных задач рационально выполнять локально, а какие выгоднее оставить внешней multimodal/image модели;
- стоит ли оформлять этот pipeline как постоянный инструмент/skill для AI-агентов.
Важное ограничение
Не считать заранее доказанным, что причиной зависаний Codex является именно расход токенов или генерация изображений на стороне модели. Это наблюдаемая корреляция, которую эксперимент должен помочь отделить от других причин. Цель — проверить практическую эффективность альтернативного workflow, а не заранее объяснить внутреннюю причину зависаний Codex.