llama.cpp для Windows

ggml-org (команда ggml.ai, з 2026 — у складі Hugging Face) · оновлено 5 жовтня 2026

Безкоштовно Windows x64 / ARM64; збірки CPU, CUDA 12.4/13.4, Vulkan, ROCm, SYCL, OpenVINO; на x86 — оптимізації AVX/AVX2/AVX512 MIT

llama.cpp — відкритий рушій на C/C++ для запуску великих мовних моделей на власному комп'ютері. Працює з моделями GGUF, має консольний чат і локальний сервер із веб-інтерфейсом.

Скачати З сайту розробника Версія перевірена 11 жовтня 2026

Середня оцінка з'явиться після 5 оцінок. Натисніть зірку, щоб оцінити.

Скріншоти

Огляд

llama.cpp — відкритий рушій для Windows, macOS і Linux, який запускає великі мовні моделі прямо на вашому комп'ютері. Його розвиває спільнота ggml-org, команда якої нині входить до складу Hugging Face. Скачати llama.cpp варто тим, хто хоче працювати з локальним ШІ напряму, без посередницьких програм.

Що таке llama.cpp

Це програма на C/C++, яка вміє ефективно виконувати мовні моделі на звичайному залізі — від ноутбука без відеокарти до потужної робочої станції. Саме вона стала основою для цілої екосистеми: LM Studio, Ollama, Jan та інші графічні застосунки використовують llama.cpp «під капотом». Рушій працює з моделями у форматі GGUF, який підтримує квантування — стиснення моделі, щоб вона займала менше пам'яті з помірною втратою якості. Завдяки цьому моделі, які раніше вимагали серверних відеокарт, запускаються на домашніх ПК. Обираючи llama.cpp безпосередньо, ви отримуєте нові функції раніше за оболонки й можете тонко налаштувати кожен параметр генерації. Ціна цього — робота переважно в командному рядку й англійський інтерфейс.

Можливості

  • Консольний режим чату з моделлю.
  • Локальний сервер із вбудованим веб-інтерфейсом і OpenAI-сумісним API.
  • Збірки для процесора та для відеокарт через CUDA, Vulkan, ROCm, SYCL і OpenVINO.
  • Оптимізації AVX, AVX2 та AVX512 на процесорах x86.
  • Підтримка Windows на x64 та ARM64.
  • Робота з квантованими моделями GGUF.

Встановлення

Кнопка на сторінці веде на офіційну сторінку релізів у репозиторії ggml-org на GitHub. Нові збірки з'являються там дуже часто, тому прямого посилання на один файл ми не даємо. Є два шляхи. Перший — офіційний скрипт встановлення для PowerShell, описаний у README проєкту. Другий — завантажити zip-архів, який відповідає вашому залізу: для відеокарт NVIDIA — з CUDA, для інших — з Vulkan, без відеокарти — збірку для процесора. Архів достатньо розпакувати в окрему теку. Далі завантажте модель GGUF з Hugging Face, запустіть консольний чат або сервер і відкрийте веб-інтерфейс у браузері за адресою, яку покаже програма.

Вимоги

Підійде 64-бітна Windows на x64 чи ARM64. Головне обмеження — пам'ять: модель має поміститися в оперативну чи відеопам'ять, тож для великих моделей знадобиться потужний комп'ютер. Наявність відеокарти суттєво прискорює роботу, але не обов'язкова.

Безпека

Беріть збірки лише зі сторінки релізів офіційного репозиторію ggml-org. Сторонні «зручні пакети» з форумів можуть містити зайве. Моделі завантажуйте з відомих акаунтів на Hugging Face. Якщо запускаєте сервер, не відкривайте його порт у зовнішню мережу без пароля чи ключа API: інакше вашою моделлю зможе користуватися будь-хто.

Кому підійде

Розробникам, які вбудовують локальну модель у свої програми через API. Ентузіастам, що хочуть першими пробувати нові моделі й налаштування. Адміністраторам, яким потрібен легкий сервер ШІ всередині компанії. Новачкам зручніше почати з графічних оболонок, а до llama.cpp повернутися, коли захочеться більше контролю.

Поради

Почніть із невеликої квантованої моделі, щоб перевірити, чи правильно підібрано збірку під вашу відеокарту. Стежте за повідомленнями в консолі під час запуску: там видно, скільки шарів моделі потрапило на GPU. Оновлюйтеся регулярно — виправлення й прискорення з'являються постійно.

Що робити, якщо модель працює повільно

Найчастіше причина в тому, що обрано збірку для процесора, хоча в комп'ютері є відеокарта, або модель не вміщається у відеопам'ять повністю. Спробуйте збірку з CUDA чи Vulkan і меншу квантовану версію моделі. Закрийте важкі програми, які займають пам'ять. Якщо ж відповідей узагалі немає, перевірте, чи не блокує брандмауер локальний сервер.

Ціна, плюси і мінуси

llama.cpp безкоштовний з відкритим кодом. Плюси — гнучкість, швидкість і широка підтримка заліза. Мінуси — командний рядок, англійський інтерфейс і необхідність самостійно розібратися зі збірками та моделями.

Сторінку опубліковано 11 жовтня 2026, текст оновлено 11 жовтня 2026, джерела перевірено 11 жовтня 2026.

Схожі програми

Усі штучний інтелект

ChatGPT

ChatGPT для Windows — офіційний застосунок OpenAI з Microsoft Store, що поєднує чат із режимами роботи й програмування Codex. Базовий доступ безкоштовний із лімітами.

Штучний інтелект 901 МБ

Claude

Claude для Windows — офіційний настільний застосунок Anthropic для роботи зі штучним інтелектом: чат, файли, браузер і підключення сервісів через MCP. Є безкоштовний план із лімітами.

Штучний інтелект 281 МБ

DeepSeek

DeepSeek — безкоштовний чат-бот зі штучним інтелектом, який працює в браузері: відповідає на питання, пише тексти й код. Потрібна реєстрація.

Штучний інтелект

Google Gemini

Офіційний застосунок Google Gemini для Windows: ШІ-асистент викликається поверх будь-якого вікна поєднанням клавіш, а історія синхронізується з акаунтом Google.

Штучний інтелект 13 МБ

Jan

Jan — безкоштовна відкрита програма для Windows, яка запускає мовні моделі прямо на комп'ютері без інтернету. За бажанням до неї можна підключити хмарні моделі через власний API-ключ.

Штучний інтелект 531 МБ

LM Studio

LM Studio — програма для Windows, що дає змогу завантажувати й запускати мовні моделі на власному комп'ютері. Має каталог моделей, чат і локальний сервер, сумісний з OpenAI API.

Штучний інтелект 590 МБ

Microsoft Copilot

Microsoft Copilot — безкоштовний асистент зі штучним інтелектом для Windows: чат, голосові розмови, Copilot Vision і пошук файлів. Викликається поєднанням клавіш Win+C.

Штучний інтелект 334 МБ

Ollama

Ollama — безкоштовна відкрита програма для Windows, яка завантажує й запускає мовні моделі на вашому комп'ютері однією командою. Має бібліотеку моделей, локальний API і простий чат.

Штучний інтелект 1,5 ГБ