Nhiệm vụ: Nghiên cứu tạo ảnh cục bộ thông qua ComfyUI cho các AI agent

Nghiên cứu tạo ảnh cục bộ thông qua ComfyUI cho các AI agent

29.09.2026fi1osof.ru

Kiểm tra xem có thể chuyển việc tạo ảnh từ Codex/ChatGPT sang ComfyUI cục bộ hay không, để lại phần lập nhiệm vụ, prompt và kiểm tra bằng thị giác (vision) cho agent, nhằm giảm tiêu thụ token và hiện tượng đơ khi làm việc với hình ảnh.

Bối cảnh

Khi làm việc trong Codex cục bộ theo gói đăng ký, người ta thường quan sát thấy vấn đề về độ ổn định của các đoạn chat dài, đặc biệt là khi agent bắt đầu làm việc tích cực với hình ảnh và bản mẫu (layout).

Quan sát thực tế:

«Codex cũng được "vibe-code" sẵn. Các đoạn chat liên tục bị đơ. Nếu nó đã đứng hình thì là đứng luôn. Không có lỗi lầm gì cả. Chỉ là chờ đợi lâu, rồi kết nối lại. Bắt đầu chat mới — và nó lại chạy bình thường. Cho đến khi lại đơ tiếp».

Và một ý kiến khác:

«Ngay khi bắt đầu làm việc với hình ảnh là nó đơ rất nhanh».

Ngoài việc bị đơ, việc tạo/xử lý hình ảnh bên trong phiên AI làm tiêu tốn đáng kể ngữ cảnh/token và có thể khiến công việc thiết kế mang tính lặp đi lặp lại trở nên tốn kém và kém ổn định.

Giả thuyết

Tách biệt phần suy luận/thị giác (reasoning/vision) và việc tạo ảnh trực tiếp.

Để AI agent chịu trách nhiệm về:

  • Hiểu nhiệm vụ và các yêu cầu về UI/visual;
  • Chuẩn bị và tinh chỉnh prompt;
  • Lựa chọn tham số/phương án tạo ảnh;
  • Phân tích hình ảnh thu được thông qua thị giác (vision);
  • So sánh với các yêu cầu/tham chiếu (reference);
  • Hình thành vòng lặp tiếp theo;
  • Quyết định xem kết quả đã đủ tốt chưa.

Việc tạo ảnh nặng thực hiện cục bộ thông qua ComfyUI và các mô hình/workflow tạo ảnh cục bộ phù hợp.

Chu trình dự kiến:

requirements / UI hiện tại
        ↓
AI agent
        ↓
prompt + tham số tạo ảnh
        ↓
ComfyUI cục bộ
        ↓
(các) hình ảnh
        ↓
AI vision review
        ↓
chỉnh sửa prompt / tham số
        ↺

Nghĩa là sử dụng mô hình đa phương thức đắt đỏ chủ yếu ở nơi nó hữu ích nhất: cho việc lập nhiệm vụ, suy luận và kiểm tra kết quả, còn việc tạo hàng loạt pixel thì đưa ra ngoài một pipeline cục bộ chuyên biệt.

Cần nghiên cứu gì

  1. Thiết lập một ComfyUI cục bộ có khả năng tái tạo.
  2. Lựa chọn tập hợp tối thiểu các mô hình/workflow cho UI mockup, hình minh họa và các tác vụ phát triển trực quan điển hình khác.
  3. Xác định giao diện lập trình đơn giản để coding agent có thể chạy workflow và nhận kết quả mà không cần thao tác thủ công trong UI của ComfyUI.
  4. Kiểm tra xem agent có thể tự thực hiện chu trình prompt → generate → inspect → adjust → generate hay không.
  5. Kiểm tra việc làm việc với nhiều ứng viên (candidate) và chọn ra kết quả tốt nhất.
  6. Xác định dữ liệu trung gian nào thực sự cần trả về ngữ cảnh AI, và dữ liệu nào có thể lưu cục bộ để tránh làm phình to phiên làm việc.
  7. Nghiên cứu xem có thể cô lập workflow tạo ảnh khỏi đoạn chat lập trình chính hay không, để các vòng lặp trực quan không làm giảm độ ổn định của ngữ cảnh chính.
  8. Ghi nhận các lỗi thực tế (failure modes): ComfyUI bị đơ, thiếu VRAM/RAM, tác vụ tạo ảnh kéo dài, prompt không chính xác, sự cố vision-review, tích tụ file, v.v.
  9. So sánh với workflow hiện tại.

Thực hiện một số tác vụ trực quan giống nhau bằng hai cách:

A. Phương pháp hiện tại

AI/Codex/ChatGPT tự làm việc với việc tạo ảnh bên trong phiên đa phương thức của chính nó.

B. Pipeline cục bộ

AI tạo ra nhiệm vụ và kiểm tra kết quả, còn việc tạo ảnh do ComfyUI thực hiện.

Đối với mỗi kịch bản, cần ghi nhận:

  • Thời gian thực tế (wall-clock time) để đạt được kết quả chấp nhận được;
  • Số lượng vòng lặp;
  • Mức tiêu thụ token/ngữ cảnh (trong giới hạn có thể đo lường);
  • Độ ổn định của phiên AI chính;
  • Số lần đơ/kết nối lại/khởi động lại;
  • Chất lượng kết quả cuối cùng;
  • Khối lượng sự tham gia thủ công của con người;
  • Chi phí GPU/VRAM/RAM cục bộ;
  • Khả năng tự chẩn đoán lỗi tạo ảnh của agent.

Tiêu chí kết quả

Có được một pipeline thử nghiệm hoạt động được, trong đó coding agent có thể gọi ComfyUI cục bộ, nhận hình ảnh, tự kiểm tra trực quan và khởi chạy vòng lặp tiếp theo nếu cần.

Sau một số tác vụ thực tế, cần trả lời các câu hỏi:

  • Điều này có làm giảm mức tiêu thụ ngữ cảnh/token của AI không?
  • Đoạn chat lập trình có trở nên ổn định hơn không?
  • Toàn bộ chu trình cho đến khi đạt kết quả chấp nhận được bị chậm đi hay nhanh lên?
  • Chất lượng của các mô hình cục bộ có đủ cho công việc sản phẩm thực tế không?
  • Những loại tác vụ trực quan nào nên thực hiện cục bộ, loại nào nên để lại cho mô hình đa phương thức/tạo ảnh bên ngoài?
  • Có nên đóng gói pipeline này thành một công cụ/skill vĩnh viễn cho các AI agent không?

Hạn chế quan trọng

Không coi việc tiêu thụ token hoặc tạo ảnh ở phía mô hình là nguyên nhân đã được chứng minh chắc chắn gây ra hiện tượng đơ của Codex. Đây là một mối tương quan quan sát được, mà thí nghiệm này phải giúp tách biệt khỏi các nguyên nhân khác. Mục tiêu là kiểm tra hiệu quả thực tế của một workflow thay thế, chứ không phải giải thích trước nguyên nhân bên trong gây đơ của Codex.