Все об Arch Linux

Arch Linux будет тем, что вы из него сделаете!

Локальная LLM на Arch: сколько железа нужно для ответа

Для нормального ответа локальной LLM на Arch хватает обычного среднего ПК. На Ryzen 7 5700G с 16 потоками и чистым CPU-инференсом модель qwen2.5:3b отвечает на простые вопросы за 1-4 секунды и занимает около 1.9 ГБ RAM, а модель на 7 млрд параметров выдаёт 10-14 токенов в секунду и просит примерно 4.7 ГБ памяти. Видеокарта не обязательна: разумный баланс на таком железе даёт процессор.

Что такое локальная LLM и зачем она на Arch

Локальная LLM работает целиком на твоей машине. Никаких облаков, подписок и отправки текста на чужие серверы. Модель лежит в памяти, ответы считает твой CPU. Для Arch это естественная тема: свежие пакеты, AUR, полный контроль над системой.

Зачем это нужно? Приватность, работа без интернета, свободные эксперименты. Хочешь спросить модель о личном или рабочем, не отправляя данные в чужой дата-центр. Или просто интересно, как устроен инференс изнутри.

Сколько железа нужно на самом деле

Вот проверенные цифры с реальной машины. Ryzen 7 5700G, 16 потоков, инференс на CPU:

  • qwen2.5:3b: около 1.9 ГБ RAM, ответ на простой вопрос за 1-4 секунды
  • qwen2.5:7b: около 4.7 ГБ RAM, скорость 10-14 токенов в секунду

Разница между моделями заметная. 3b отвечает быстро, но рассуждает проще. 7b умнее, связнее, зато печатает медленнее. Для чата и коротких вопросов хватает 3b. Для пересказа, анализа текста и кода лучше 7b.

Правило простое: чем больше модель, тем больше RAM и тем медленнее ответ. На машине с 8 ГБ памяти комфортно живёт только 3b. С 16 ГБ можно держать 7b и не закрывать браузер. Проверить свободную память перед запуском можно командой free -h.

Как это выглядит на практике: CPU-инференс

На таком ПК штатная среда инференса это CPU. Встроенная Vega iGPU для ROCm нецелесообразна: поддержка слабая, прирост маленький, настройка боль. Поэтому считаем процессором.

Общий подход такой: берём раннер, скачиваем модель в формате GGUF, запускаем. Классический вариант llama.cpp. Сборка из исходников:

git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build -DGGML_NATIVE=ON
cmake --build build --config Release -j

Модель берём с Hugging Face. Для Qwen2.5-3B-Instruct есть готовые GGUF-квантования, например q4_k_m. Запуск:

./build/bin/llama-cli -m qwen2.5-3b-instruct-q4_k_m.gguf -p "Привет, кто ты?" -n 256

Квантование q4_k_m режет размер модели в разы при небольшой потере качества. Поэтому 3b помещается в 1.9 ГБ, а не в полные 6 ГБ веса. Удобно гонять модели прямо из терминала, настройку которого я разбирал в статье про Ghostty.

Доступ к Hugging Face из РФ работает напрямую: GGUF-файлы скачивались без обходов, проверял 2026-09-12. Так что вопрос не в сети, а в железе.

На этой машине эксперимент с локальной LLM свёрнут: раннер убран из системы по моему решению. Но цифры выше сняты честно, на реальном железе, и подход остаётся рабочим для любого Arch.

Почему видеокарта не обязательна

Для маленьких моделей GPU не нужен. CPU справляется, а настройка видеокарты добавляет головной боли. Если у тебя NVIDIA, можно выгрузить часть слоёв на GPU и ускорить генерацию, об этом я писал в статье про драйверы NVIDIA. Но для 3b и 7b на среднем CPU разница не окупает возню.

ROCm на встроенной Vega не вариант: поддержка iGPU слабая, а прирост скорости мизерный. Проще оставить инференс на CPU и не трогать графику.

Типичные проблемы и их решения

Модель не влезает в RAM. Система уходит в swap, всё начинает тормозить, интерфейс замирает. Лечится выбором модели поменьше или квантования погрубее. Перед запуском глянь free -h: если свободно меньше гигабайта, модель будет жить в swap. Если зависания уже случаются при высокой нагрузке, посмотри статью про фикс фризов.

CPU грузится на 100% во время генерации. Это нормально для инференса, но на ноутбуке греется корпус и шумят вентиляторы. Следи за температурой, при длинных генерациях делай паузы.

Первый токен приходит долго. Модель загружается в память, это занимает несколько секунд. Дальше генерация идёт ровно. Не пугайся паузы в начале.

Частые вопросы

Сколько RAM нужно для локальной LLM на Arch?

Для модели на 3 млрд параметров хватает 8 ГБ, комфортно 16 ГБ. Модель на 7 млрд просит около 4.7 ГБ только под себя, плюс система и браузер. Итого 16 ГБ и больше.

Какая модель лучше для слабого ПК: 3b или 7b?

Для быстрых ответов на простые вопросы бери 3b. Для связных рассуждений, пересказа и кода лучше 7b, но готовься к скорости 10-14 токенов в секунду.

Нужна ли видеокарта для локальной LLM?

Нет. На CPU маленькие модели работают нормально. Видеокарта ускоряет большие модели, но для 3b и 7b на среднем процессоре она не обязательна.

Что такое токены в секунду?

Это скорость генерации. Токен примерно равен части слова. 10-14 токенов в секунду это медленное, но читаемое печатание. Человек читает быстрее, чем модель печатает.

Можно ли запустить LLM на ноутбуке?

Можно, если есть 8-16 ГБ RAM и современный CPU. Учти нагрев и шум вентиляторов при длинной генерации.

Заключение

Локальная LLM на Arch реально работает на среднем железе. 3b отвечает за секунды, 7b думает дольше, но умнее. Главные ресурсы это RAM и CPU, видеокарта не обязательна. Начни с маленькой модели, посмотри на скорость, потом решай, нужна ли больше.

Полезные ресурсы

  • llama.cpp на GitHub: https://github.com/ggml-org/llama.cpp
  • ArchWiki про AMDGPU: https://wiki.archlinux.org/title/AMDGPU


Не получилось? Поможем настроить

Задай вопрос в чате — отвечаем быстро, по делу и без воды.

Читайте также

Комментарии

Загрузка…

Откроется GitHub: создайте новый issue с вашим комментарием (кнопка «Submit new issue»). После отправки обновите эту страницу — комментарий появится ниже.

Telegram Max