Огляд
llama.cpp — відкритий рушій для Windows, macOS і Linux, який запускає великі мовні моделі прямо на вашому комп'ютері. Його розвиває спільнота ggml-org, команда якої нині входить до складу Hugging Face. Скачати llama.cpp варто тим, хто хоче працювати з локальним ШІ напряму, без посередницьких програм.
Що таке llama.cpp
Це програма на C/C++, яка вміє ефективно виконувати мовні моделі на звичайному залізі — від ноутбука без відеокарти до потужної робочої станції. Саме вона стала основою для цілої екосистеми: LM Studio, Ollama, Jan та інші графічні застосунки використовують llama.cpp «під капотом». Рушій працює з моделями у форматі GGUF, який підтримує квантування — стиснення моделі, щоб вона займала менше пам'яті з помірною втратою якості. Завдяки цьому моделі, які раніше вимагали серверних відеокарт, запускаються на домашніх ПК. Обираючи llama.cpp безпосередньо, ви отримуєте нові функції раніше за оболонки й можете тонко налаштувати кожен параметр генерації. Ціна цього — робота переважно в командному рядку й англійський інтерфейс.
Можливості
- Консольний режим чату з моделлю.
- Локальний сервер із вбудованим веб-інтерфейсом і OpenAI-сумісним API.
- Збірки для процесора та для відеокарт через CUDA, Vulkan, ROCm, SYCL і OpenVINO.
- Оптимізації AVX, AVX2 та AVX512 на процесорах x86.
- Підтримка Windows на x64 та ARM64.
- Робота з квантованими моделями GGUF.
Встановлення
Кнопка на сторінці веде на офіційну сторінку релізів у репозиторії ggml-org на GitHub. Нові збірки з'являються там дуже часто, тому прямого посилання на один файл ми не даємо. Є два шляхи. Перший — офіційний скрипт встановлення для PowerShell, описаний у README проєкту. Другий — завантажити zip-архів, який відповідає вашому залізу: для відеокарт NVIDIA — з CUDA, для інших — з Vulkan, без відеокарти — збірку для процесора. Архів достатньо розпакувати в окрему теку. Далі завантажте модель GGUF з Hugging Face, запустіть консольний чат або сервер і відкрийте веб-інтерфейс у браузері за адресою, яку покаже програма.
Вимоги
Підійде 64-бітна Windows на x64 чи ARM64. Головне обмеження — пам'ять: модель має поміститися в оперативну чи відеопам'ять, тож для великих моделей знадобиться потужний комп'ютер. Наявність відеокарти суттєво прискорює роботу, але не обов'язкова.
Безпека
Беріть збірки лише зі сторінки релізів офіційного репозиторію ggml-org. Сторонні «зручні пакети» з форумів можуть містити зайве. Моделі завантажуйте з відомих акаунтів на Hugging Face. Якщо запускаєте сервер, не відкривайте його порт у зовнішню мережу без пароля чи ключа API: інакше вашою моделлю зможе користуватися будь-хто.
Кому підійде
Розробникам, які вбудовують локальну модель у свої програми через API. Ентузіастам, що хочуть першими пробувати нові моделі й налаштування. Адміністраторам, яким потрібен легкий сервер ШІ всередині компанії. Новачкам зручніше почати з графічних оболонок, а до llama.cpp повернутися, коли захочеться більше контролю.
Поради
Почніть із невеликої квантованої моделі, щоб перевірити, чи правильно підібрано збірку під вашу відеокарту. Стежте за повідомленнями в консолі під час запуску: там видно, скільки шарів моделі потрапило на GPU. Оновлюйтеся регулярно — виправлення й прискорення з'являються постійно.
Що робити, якщо модель працює повільно
Найчастіше причина в тому, що обрано збірку для процесора, хоча в комп'ютері є відеокарта, або модель не вміщається у відеопам'ять повністю. Спробуйте збірку з CUDA чи Vulkan і меншу квантовану версію моделі. Закрийте важкі програми, які займають пам'ять. Якщо ж відповідей узагалі немає, перевірте, чи не блокує брандмауер локальний сервер.
Ціна, плюси і мінуси
llama.cpp безкоштовний з відкритим кодом. Плюси — гнучкість, швидкість і широка підтримка заліза. Мінуси — командний рядок, англійський інтерфейс і необхідність самостійно розібратися зі збірками та моделями.
Сторінку опубліковано 11 жовтня 2026, текст оновлено 11 жовтня 2026, джерела перевірено 11 жовтня 2026.