Задача Ресерч Qwen coder

Ресерч Qwen coder

16.06.2026

Надо локально на RTX5080 16G запустить модель и попробовать в какой-нить IDE погонять.

Ворклоги

Qwen3-14B-UD-Q4_K_XL.gguf не взлетает- памяти не хватает.

ggml_backend_cuda_buffer_type_alloc_buffer: allocating 15640.00 MiB on device 0: cudaMalloc failed: out of memory
llama-1  | 0.08.435.021 E alloc_tensor_range: failed to allocate CUDA0 buffer of size 16399728640

Засада. Официальное квеновское расширение Qwen Code Companion для vscode не поддерживает работу с локальной моделью.

Qwen Code cli вроде как умеет работать с локальной, но мне пока это не подходит. Мне надо именно в IDE.

Qwen3-14B-UD-Q3_K_XL.gguf тоже не запускается, тоже памяти не хватает.

Изучу парочку претендентов.

https://github.com/continuedev/continue - расширение для vscode

https://github.com/cline/cline - не только расширение, но и два дополнительных режима:

  • Cli

Run Cline in your terminal. Interactive chat or fully headless for CI/CD and scripting.

npm i -g cline
  • Kanban

Run many agents in parallel from a web-based task board. Each card gets its own worktree, auto-commit, and dependency chains.

npm i -g kanban

Qwen3-14B-UD-Q4_K_XL.gguf не взлетает- памяти не хватает.

ggml_backend_cuda_buffer_type_alloc_buffer: allocating 15640.00 MiB on device 0: cudaMalloc failed: out of memory
llama-1  | 0.08.435.021 E alloc_tensor_range: failed to allocate CUDA0 buffer of size 16399728640

Вот тут я сам проигрался. У меня оказывается контекст 100 000 токенов был выставлен, и память вся сжиралась на кеш.

Уменьшил контекст до 1 000. Это, конечно, вообще ни о чем, но пойдет для замера. Потребление памяти 6 гигов.

10 000 контекст - 7.5 гигов

50 000 контекст - 13.7 гига. Уже в притые, но и 50к контекст - вполне так уже для экспериментов должно хватить.

cline на первый взгляд очень интересный, особенно его вариант canban. Он позволяет работать с гит-проектами в минималистичном агентом режиме в классической канбан-доске. Идея в том, что каждая задача - это своя карточка. Карточка создается в беклоге, после чего отправляется в работу. Агент выполняет поставленную задачу и карточка переводится в колонку ревью. Там вы можете задачу уже перевести в Завершена или прям там продолжить общение с агентом в рамках задачи. Как по мне, очень удобно.