llama.cpp для Windows

ggml-org (команда ggml.ai, з 2026 — у складі Hugging Face) · обновлено 5 октября 2026

Бесплатно Windows x64 / ARM64; збірки CPU, CUDA 12.4/13.4, Vulkan, ROCm, SYCL, OpenVINO; на x86 — оптимізації AVX/AVX2/AVX512 MIT

llama.cpp — открытый движок на C/C++ для запуска больших языковых моделей на собственном компьютере. Работает с моделями GGUF, есть консольный чат и локальный сервер с веб-интерфейсом.

Скачать С сайта разработчика Версия проверена 11 октября 2026

Средняя оценка появится после 5 оценок. Нажмите звезду, чтобы оценить.

Скриншоты

Обзор

llama.cpp — открытый движок для Windows, macOS и Linux, который запускает большие языковые модели прямо на вашем компьютере. Его развивает сообщество ggml-org, чья команда сейчас входит в состав Hugging Face. Скачать llama.cpp стоит тем, кто хочет работать с локальным ИИ напрямую, без программ-посредников.

Что такое llama.cpp

Это программа на C/C++, которая умеет эффективно выполнять языковые модели на обычном железе — от ноутбука без видеокарты до мощной рабочей станции. Именно она стала основой целой экосистемы: LM Studio, Ollama, Jan и другие графические приложения используют llama.cpp «под капотом». Движок работает с моделями в формате GGUF, который поддерживает квантование — сжатие модели, чтобы она занимала меньше памяти при умеренной потере качества. Благодаря этому модели, которым раньше требовались серверные видеокарты, запускаются на домашних ПК. Выбирая llama.cpp напрямую, вы получаете новые функции раньше оболочек и можете тонко настроить каждый параметр генерации. Плата за это — работа в основном в командной строке и английский интерфейс.

Возможности

  • Консольный режим чата с моделью.
  • Локальный сервер со встроенным веб-интерфейсом и OpenAI-совместимым API.
  • Сборки для процессора и для видеокарт через CUDA, Vulkan, ROCm, SYCL и OpenVINO.
  • Оптимизации AVX, AVX2 и AVX512 на процессорах x86.
  • Поддержка Windows на x64 и ARM64.
  • Работа с квантованными моделями GGUF.

Установка

Кнопка на странице ведёт на официальную страницу релизов в репозитории ggml-org на GitHub. Новые сборки появляются там очень часто, поэтому прямой ссылки на один файл мы не даём. Путей два. Первый — официальный скрипт установки для PowerShell, описанный в README проекта. Второй — скачать zip-архив под ваше железо: для видеокарт NVIDIA — с CUDA, для остальных — с Vulkan, без видеокарты — сборку для процессора. Архив достаточно распаковать в отдельную папку. Затем скачайте модель GGUF с Hugging Face, запустите консольный чат или сервер и откройте веб-интерфейс в браузере по адресу, который покажет программа.

Требования

Подойдёт 64-битная Windows на x64 или ARM64. Главное ограничение — память: модель должна поместиться в оперативную или видеопамять, так что для крупных моделей понадобится мощный компьютер. Видеокарта заметно ускоряет работу, но не обязательна.

Безопасность

Берите сборки только со страницы релизов официального репозитория ggml-org. Сторонние «удобные пакеты» с форумов могут содержать лишнее. Модели скачивайте с известных аккаунтов на Hugging Face. Если запускаете сервер, не открывайте его порт во внешнюю сеть без пароля или ключа API: иначе вашей моделью сможет пользоваться кто угодно.

Кому подойдёт

Разработчикам, которые встраивают локальную модель в свои программы через API. Энтузиастам, которые хотят пробовать новые модели и настройки сразу после выхода. Администраторам, которым нужен лёгкий ИИ-сервер внутри компании. Новичкам удобнее начать с графических оболочек, а к llama.cpp вернуться, когда захочется больше контроля.

Советы

Начните с небольшой квантованной модели, чтобы проверить, правильно ли подобрана сборка под вашу видеокарту. Следите за сообщениями в консоли при запуске: там видно, сколько слоёв модели попало на GPU. Обновляйтесь регулярно — исправления и ускорения появляются постоянно.

Что делать, если модель работает медленно

Обычно причина в том, что выбрана сборка для процессора, хотя в компьютере есть видеокарта, или модель не помещается в видеопамять целиком. Попробуйте сборку с CUDA или Vulkan и меньшую квантованную версию модели. Закройте тяжёлые программы, которые занимают память. Если же ответов нет совсем, проверьте, не блокирует ли брандмауэр локальный сервер.

Цена, плюсы и минусы

llama.cpp бесплатен и с открытым кодом. Плюсы — гибкость, скорость и широкая поддержка железа. Минусы — командная строка, английский интерфейс и необходимость самостоятельно разобраться со сборками и моделями.

Страница опубликована 11 октября 2026, текст обновлён 11 октября 2026, источники проверены 11 октября 2026.

Похожие программы

Все искусственный интеллект

ChatGPT

ChatGPT для Windows — официальное приложение OpenAI из Microsoft Store, которое объединяет чат с режимами работы и программирования Codex. Базовый доступ бесплатный, с лимитами.

Искусственный интеллект 901 МБ

Claude

Claude для Windows — официальное настольное приложение Anthropic для работы с искусственным интеллектом: чат, файлы, браузер и подключение сервисов через MCP. Есть бесплатный план с лимитами.

Искусственный интеллект 281 МБ

DeepSeek

DeepSeek — бесплатный чат-бот с искусственным интеллектом, который работает в браузере: отвечает на вопросы, пишет тексты и код. Нужна регистрация.

Искусственный интеллект

Google Gemini

Официальное приложение Google Gemini для Windows: ИИ-ассистент вызывается поверх любого окна сочетанием клавиш, а история синхронизируется с аккаунтом Google.

Искусственный интеллект 13 МБ

Jan

Jan — бесплатная открытая программа для Windows, которая запускает языковые модели прямо на компьютере без интернета. При желании к ней можно подключить облачные модели через собственный API-ключ.

Искусственный интеллект 531 МБ

LM Studio

LM Studio — программа для Windows, которая позволяет скачивать и запускать языковые модели на собственном компьютере. В ней есть каталог моделей, чат и локальный сервер, совместимый с OpenAI API.

Искусственный интеллект 590 МБ

Microsoft Copilot

Microsoft Copilot — бесплатный ассистент с искусственным интеллектом для Windows: чат, голосовые разговоры, Copilot Vision и поиск файлов. Вызывается сочетанием клавиш Win+C.

Искусственный интеллект 334 МБ

Ollama

Ollama — бесплатная открытая программа для Windows, которая скачивает и запускает языковые модели на вашем компьютере одной командой. Есть библиотека моделей, локальный API и простой чат.

Искусственный интеллект 1,5 ГБ