Задача Ресерч Qwen coder
Ресерч Qwen coder
Надо локально на RTX5080 16G запустить модель и попробовать в какой-нить IDE погонять.
Ворклоги
Qwen3-14B-UD-Q4_K_XL.gguf не взлетает- памяти не хватает.
ggml_backend_cuda_buffer_type_alloc_buffer: allocating 15640.00 MiB on device 0: cudaMalloc failed: out of memory
llama-1 | 0.08.435.021 E alloc_tensor_range: failed to allocate CUDA0 buffer of size 16399728640
Засада. Официальное квеновское расширение Qwen Code Companion для vscode не поддерживает работу с локальной моделью.
Qwen Code cli вроде как умеет работать с локальной, но мне пока это не подходит. Мне надо именно в IDE.
Qwen3-14B-UD-Q3_K_XL.gguf тоже не запускается, тоже памяти не хватает.
Изучу парочку претендентов.
https://github.com/continuedev/continue - расширение для vscode
https://github.com/cline/cline - не только расширение, но и два дополнительных режима:
- Cli
Run Cline in your terminal. Interactive chat or fully headless for CI/CD and scripting.
npm i -g cline
- Kanban
Run many agents in parallel from a web-based task board. Each card gets its own worktree, auto-commit, and dependency chains.
npm i -g kanban
Qwen3-14B-UD-Q4_K_XL.gguf не взлетает- памяти не хватает.
ggml_backend_cuda_buffer_type_alloc_buffer: allocating 15640.00 MiB on device 0: cudaMalloc failed: out of memory
llama-1 | 0.08.435.021 E alloc_tensor_range: failed to allocate CUDA0 buffer of size 16399728640
Вот тут я сам проигрался. У меня оказывается контекст 100 000 токенов был выставлен, и память вся сжиралась на кеш.
Уменьшил контекст до 1 000. Это, конечно, вообще ни о чем, но пойдет для замера. Потребление памяти 6 гигов.
10 000 контекст - 7.5 гигов
50 000 контекст - 13.7 гига. Уже в притые, но и 50к контекст - вполне так уже для экспериментов должно хватить.
cline на первый взгляд очень интересный, особенно его вариант canban. Он позволяет работать с гит-проектами в минималистичном агентом режиме в классической канбан-доске. Идея в том, что каждая задача - это своя карточка. Карточка создается в беклоге, после чего отправляется в работу. Агент выполняет поставленную задачу и карточка переводится в колонку ревью. Там вы можете задачу уже перевести в Завершена или прям там продолжить общение с агентом в рамках задачи. Как по мне, очень удобно.
