Nhiệm vụ: Tìm hiểu xem những mô hình nào tạo ra các bố cục và infographic tốt hơn
Tìm hiểu xem những mô hình nào tạo ra các bố cục và infographic tốt hơn
Cần có khả năng tạo ra cả bố cục tổng thể lẫn các yếu tố và thành phần riêng lẻ. Ngoài ra cũng cần các infographic có chứa văn bản, bởi vì văn bản vốn là một điểm yếu trong việc tạo ảnh. Dường như phiên bản Qwen mới nhất đã khoe khoang về tính năng này.
Ворклоги
black-forest-labs/flux.2-pro làm cực kỳ tệ về mặt văn bản và phông chữ )))

Đây là giao diện nháp với tính năng chọn nhiều mô hình mà tôi vừa làm xong:


Và bây giờ hãy thử chạy tất cả các mô hình này với chỉ một câu lệnh (prompt):
Trang web hiện đại dành cho kỹ sư nghiên cứu.
Đây không phải là blog cũng không phải là portfolio.
Đây là nhật ký công khai về các hoạt động kỹ thuật, hiển thị các nghiên cứu đang thực hiện, dự án, nhiệm vụ, ghi chú làm việc và tiến độ phát triển theo thời gian thực.
Nhân vật chính của trang web là Nikolai Lanets, một kỹ sư nghiên cứu trong lĩnh vực trí tuệ nhân tạo, hệ thống tác tử (agentic systems), kiến trúc bộ nhớ và đồ thị tri thức.
Phong cách:
* giao diện sáng (nhưng không nhất thiết phải là màu trắng tinh)
* thiết kế công nghệ cao cấp
* thẩm mỹ phòng thí nghiệm nghiên cứu
* sự kết hợp giữa GitHub, Linear, Notion, Stripe và các nền tảng AI hiện đại
* chủ nghĩa tối giản không có khoảng trống vô nghĩa (nhưng không quá nhồi nhét phần tử)
* mật độ thông tin trung bình
* kiểu chữ chất lượng cao
* các thẻ (card) gọn gàng
* hệ thống phân cấp trực quan nghiêm ngặt
* cảm giác của một hệ thống kỹ thuật đang hoạt động
Màn hình chính (Hero section):
Tên lớn:
Nikolai Lanets
Phụ đề:
kỹ sư nghiên cứu
Mô tả:
Nhật ký công khai về các dự án, nhiệm vụ, nghiên cứu và giải pháp kỹ thuật.
Khối riêng biệt:
sẵn sàng cho các thử thách mới
Hiển thị các hướng nghiên cứu chính ở gần đó:
* Agent Systems
* AI Research
* Memory Architectures
* Knowledge Graphs
Bên dưới, bố trí một số phần dưới dạng bảng điều khiển (dashboard) hoạt động nghiên cứu hiện đại.
Phần "Dự án đang hoạt động":
các thẻ dự án kèm trạng thái, ngày bắt đầu và mô tả ngắn gọn.
Phần "Nhiệm vụ đang thực hiện":
các nhiệm vụ nghiên cứu và kỹ thuật được hiển thị như một backlog làm việc.
Phần "Nhật ký công việc gần đây":
dòng thời gian (feed) các hành động kỹ thuật và quyết định gần đây.
Phần tải công việc (Load):
số lượng nhiệm vụ thương mại, số lượng nghiên cứu cá nhân và các cam kết hiện tại.
Ấn tượng trực quan:
Không phải trang web cá nhân.
Không phải blog.
Không phải portfolio.
Đây là hệ điều hành của nhà nghiên cứu, mở cho công chúng xem.
Cấp độ UI/UX rất cao.
Chất lượng ngang tầm các sản phẩm SaaS tốt nhất năm 2026.
Bố cục giao diện từ Figma.
Ứng dụng web desktop hoàn chỉnh.
Tôi xin nói rõ lại một lần nữa là ChatGPT đã soạn nội dung này dựa trên văn bản từ trang chủ website của tôi, tôi chỉ chỉnh sửa lại một chút. Thật thú vị khi xem mô hình nào sẽ tạo ra thiết kế gì và trong thời gian/chi phí bao nhiêu.
Dưới đây là các kết quả khác.
Gemini3_1_Flash_Image. $0.07

BLACK_FOREST_LABS_FLUX_2_KLEIN_4B. $0.016

BLACK_FOREST_LABS_FLUX_2_PRO. $0.06

BLACK_FOREST_LABS_FLUX_2_MAX. $0.13

black-forest-labs/flux.2-max suy nghĩ rất lâu, thực sự là vài phút (5-10, thậm chí có thể lâu hơn).
Судя по всему найти подходящую модель локальную для этого крайне сложно. На сколько я понимаю, обычно приходится специально под конечный задачи готовить модели, LoRa доучивать и т.п. Так же сильно упрощает процесс наличие готовых референсов. Но мне сейчас хочется именно по описанию сайта и его функционала получать макеты, потому что в том же lovable это довольно долго делается.
Đã thêm giao diện tạo ảnh này vào haih-agent với khả năng chọn mô hình, chất lượng và tỷ lệ khung hình

Nó được tối ưu cho OpenRouter, vì vậy nó mang lại quyền truy cập vào nhiều mô hình cùng lúc.
Tôi đã đưa đoạn văn bản từ trang chủ trang web của mình vào ChatGPT và yêu cầu nó viết một câu lệnh (prompt) cho trình tạo ảnh để có thể thử nghiệm và xem mô hình nào cho kết quả tốt nhất. Nhưng vì có nhiều mô hình và không muốn phải đợi từng mô hình một rồi mới so sánh kết quả sau, tôi sẽ chỉnh sửa lại giao diện một chút để có thể chọn nhiều mô hình cùng lúc, gửi nhiều yêu cầu song song và sau đó xem lại tất cả các kết quả.
Dưới đây là các kết quả đầu tiên.
Gemini3_1_Flash_Image. Chi phí $0.104

BYTEDANCE_SEED_SEEDREAM_4_5. $0.116

GOOGLE_GEMINI_3_PRO_IMAGE_PREVIEW. $0.145

Gemini2_5_Flash_Image. $0.039

OPENAI_GPT_5_4_IMAGE_2. $0.341
