Llama

Семейство моделей с открытыми весами

8,4/10
NeiroAI рекомендует

Не сервис с подпиской, а семейство моделей, которые скачиваются и запускаются у себя: от 1B на ноутбуке до 400B на серверной стойке, с рекордно заявленным контекстом до 10 миллионов токенов. Последняя открытая линейка — Llama 4, апрель 2025 года.

Флагманская модельLlama 4 Scout
Бесплатный тарифЕсть
APIЕсть
Макс. контекст10M токенов заявлено
Русский языкНе поддержан официально: в списке языков Llama 4 двенадцать позиций, русского среди них нет
Доступ из РФСтраница загрузки и репозиторий моделей открываются из России
ПлатформыЛокальный запуск: llama.cpp, Ollama, LM Studio, Jan, vLLM, SGLang, Transformers. Собственного приложения и чата нет

Данные проверены 10.08.2026. Источники: Официальная карточка Llama 4, Лицензия Llama 4, Политика допустимого использования.

Открыть Llama →

Актуальные модели

Только основная линейка, актуальная сейчас. Старые версии — в разделе «История моделей».

МодельДля чего лучшеКонтекстСтоимостьСтатус
Llama 4 Scout флагман Флагман по контексту: 17B активных из 109B, помещается в одну H100 при int4-квантовании 10M токенов заявлено Бесплатно — открытые веса Актуальная
Llama 4 Maverick Максимальное качество линейки: 17B активных из 400B, 128 экспертов. Нужен хост уровня H100 DGX 1M токенов Бесплатно — открытые веса Актуальная
Llama 3.3 70B Рабочая лошадка: качество уровня 405B при стоимости обслуживания 70B. Её хостят почти все провайдеры 128K токенов Бесплатно — открытые веса Актуальная
Llama 3.2 3B Ноутбук с 8–16 ГБ памяти: сборка занимает 2 ГБ и работает без интернета 128K токенов Бесплатно — открытые веса Актуальная
Llama 3.2 1B Самая маленькая: 1.3 ГБ загрузки, запускается на 8 ГБ оперативной памяти 128K токенов Бесплатно — открытые веса Актуальная
Llama 3.2-Vision 11B и 90B Понимание изображений локально, если не нужна архитектура четвёртого поколения 128K токенов Бесплатно — открытые веса Актуальная
Llama 3.1 8B Классика для домашней видеокарты: 4.9 ГБ, есть у всех хостеров 128K токенов Бесплатно — открытые веса Актуальная
Llama 3.1 405B Самая крупная плотная модель семейства, серверная сборка на 243 ГБ 128K токенов Бесплатно — открытые веса Актуальная

Цены за токен у продукта нет: веса скачиваются бесплатно и запускаются на своём железе. Деньги появляются только у стороннего хостера — например 0,10–0,27 доллара за миллион входных токенов и 0,30–0,85 за миллион выходных. Важная оговорка по контексту: у Scout заявлено 10 миллионов токенов, но хостеры отдают заметно меньше — у одного из них 327 680, а замеры длинного контекста в официальной карточке считались при 128 тысячах.

Какую модель выбрать

Редакционная рекомендация NeiroAI, не автоматический подбор.

Llama 3.2 3B
Для ноутбука без видеокарты

Сборка весит около 2 ГБ и работает на 8–16 ГБ оперативной памяти, контекст 128 тысяч токенов. Самый быстрый способ вообще попробовать локальную модель.

Llama 3.1 8B
Для одной игровой видеокарты

Сборка 4,9 ГБ, идёт на 8–16 ГБ видеопамяти или на Apple Silicon. Разумный компромисс между качеством и требованиями к железу.

Llama 3.3 70B
Для сервера и качества уровня флагмана

Даёт уровень 405-миллиардной модели при стоимости обслуживания 70-миллиардной. Сборка 43 ГБ: нужны две карты по 48 ГБ или 64+ ГБ единой памяти.

Llama 4 Scout
Для изображений на входе и длинного контекста

Принимает изображения — официально протестировано до пяти на запрос — и заявляет рекордное окно. Но это 67 ГБ загрузки и уровень серверного ускорителя: дома не запустится.

Llama 4 Maverick
Для максимального качества на сервере

400 млрд параметров при 17 млрд активных, контекст миллион токенов, принимает изображения. Сборка весит 245 ГБ — это серверный хост, а не рабочая станция.

Llama 3.2 1B
Для телефона и слабого железа

Самая маленькая модель семейства: 1,3 ГБ, а в квантованном виде 771 МБ. Качество соответствующее, зато запускается почти где угодно.

Llama 3.2-Vision 11B и 90B
Для изображений без перехода на четвёртую линейку

Первые мультимодальные модели семейства: принимают текст и изображения, отдают текст, контекст 128 тысяч токенов.

Llama 3.1 405B
Когда нужен максимум прошлого поколения

Самая большая плотная модель линейки 3.x, сборка 243 ГБ. Сегодня практичнее взять 3.3 70B — она даёт сопоставимый уровень при вчетверо меньшем размере.

Что умеет

Текст ★★★★★ Все линейки: вход и выход — многоязычный текст.
Код ★★★★☆ Выход официальной карточки — «текст и код».
Понимание изображений ★★★☆☆ У Llama 4 и Llama 3.2-Vision. Официально протестировано до 5 изображений на запрос, дальше — зона ответственности разработчика.
Длинный контекст ★★★★☆ Заявлено 10 миллионов токенов у Scout и 1 миллион у Maverick — рекорд среди открытых моделей. На практике доступный контекст ограничен железом и настройками хостера.
Открытые веса ★★★★★ Главное свойство продукта. Формат стал де-факто стандартом для llama.cpp, Ollama и vLLM, вокруг него самая большая экосистема дообученных производных.
Работа без интернета ★★★★★ Скачанные веса запускаются полностью офлайн, при инференсе обращений наружу нет. Доступность не зависит ни от блокировок, ни от платёжных ограничений, ни от решения вендора отключить регион.
Дообучение ★★★★★ Лицензия прямо допускает дообучение, дистилляцию и генерацию синтетических данных. При распространении производной её имя должно начинаться со слова Llama.
Вызов инструментов ★★★★☆ Function calling поддержан у линеек 3.1, 3.2, 3.3 и 4.
Русский язык Нет Официально поддержанных языков у Llama 4 двенадцать, русского среди них нет; у Llama 3.3 — восемь, тоже без русского. Модель может отвечать по-русски, но вендор эту поддержку не заявляет.
Генерация изображений Нет Выход всех моделей — только текст и код.
Голос Нет Голосовых моделей в семействе нет.
Веб-поиск Нет Поиск — функция обвязки, а не самой модели. Его добавляет тот, кто разворачивает.
Видео на вход Нет Официальная карточка перечисляет только текст и изображение.

Что изменилось

Лента фиксирует разницу между обходами данных.

Это первый снимок данных этой страницы — истории изменений ещё нет: чтобы зафиксировать разницу, нужны минимум два обхода. Лента начнёт заполняться автоматически со следующей проверки.

Тарифы и цены

Локальный запуск
0 ₽

Веса раздаются бесплатно и бессрочно, платите только за своё железо. Готовые сборки: 1.3 ГБ у версии 1B, 2 ГБ у 3B, 4.9 ГБ у 8B, 43 ГБ у 70B, 67 ГБ у Scout и 245 ГБ у Maverick. Поддерживаются llama.cpp, Ollama, LM Studio, Jan, vLLM, SGLang и Transformers.

Сторонние хостеры

Если своего железа нет, модель арендуется по токенам у стороннего провайдера: около 0,27 доллара за миллион входных и 0,85 за миллион выходных у Maverick, 0,10 и 0,30 у Scout. Учтите, что четвёртое поколение хостят не все — у части провайдеров в продакшене только линейка 3.x.

Подписки нет

У продукта нет ни подписки, ни личного кабинета, ни собственного чат-интерфейса. Попробовать без установки можно только на сторонних площадках.

Оценка NeiroAI

Личное мнение
Дэми Авалонов — эксперт NeiroAI Дэми Авалонов основатель NeiroAI · 12.08.2026

Метка «Бесплатные» здесь означает не бесплатный тариф, а другое: веса скачиваются даром и запускаются на своём железе — платить попросту не за что и некому. Своего чата, приложения и публичного API у семейства нет, программный доступ дают сторонние хостеры по своим ценам. Отсюда главный вывод: Llama — это двигатель, а не машина. Она даёт текст, код, понимание изображений и рекордный заявленный контекст, но не рисует, не говорит и не ищет в интернете — всё это добавляет тот, кто её разворачивает. И ещё одно, о чём честно предупредить сразу: последняя открытая линейка датирована апрелем 2025 года.

Сильные стороны

  • Веса бесплатны, а запуск полностью офлайн — доступность не зависит ни от VPN, ни от зарубежной карты
  • Вилка размеров от 1 млрд параметров на ноутбук до 400 млрд на серверную стойку — редкость даже среди открытых моделей
  • Формат стал де-факто стандартом: llama.cpp, Ollama, vLLM, LM Studio и огромная экосистема дообученных производных
  • Лицензия прямо разрешает дообучение, дистилляцию и коммерческое использование; порог в 700 млн активных пользователей в месяц для российского бизнеса неактуален
  • Заявленный контекст до 10 млн токенов у Scout — рекорд среди моделей с открытыми весами

Слабые стороны

  • Последняя открытая линейка вышла в апреле 2025 года — больше года без нового поколения
  • Русского нет в списке официально поддерживаемых языков: у четвёртой линейки их двенадцать, у 3.3 — восемь
  • Своего чата, приложения и публичного API у семейства нет — программный доступ только через сторонних хостеров
  • Официальное скачивание требует аккаунта, принятия лицензии и анкеты с именем, датой рождения и названием организации
  • Заявленный контекст не равен доступному: у публичного хостера Scout отдаёт 327 680 токенов вместо заявленных 10 миллионов
  • Мультимодальные модели четвёртой линейки не лицензируются лицам и компаниям из Европейского союза
Кому подойдёттем, кто готов развернуть модель у себя — от ноутбука до сервера — и не зависеть ни от блокировок, ни от платёжных ограничений
Кому не подойдёттем, кому нужен готовый сервис с чатом, приложением и официальной поддержкой русского языка

Доступ из России

Пока только по официальным документам сервиса: живую регистрацию и оплату из России редакция проверяет отдельно, до этого статус ниже — заявленный, а не испытанный.

Сайт Страница загрузки и репозиторий моделей открываются из России
Регистрация Официальное скачивание требует аккаунта, принятия лицензии и анкеты: имя, дата рождения, организация. Часть зеркал раздаёт сборки без анкеты
Нужен VPN Не нужен: обе официальные площадки отвечают с российского адреса
Российская карта Неприменимо: веса бесплатны, платить за продукт не за что
API Своего публичного API у семейства нет, но программный доступ к моделям штатный: OpenAI-совместимые эндпоинты у сторонних хостеров (Together AI, DeepInfra, Groq, AWS Bedrock) и у локальных серверов vLLM или Ollama

С чем сравнить

Llama VS DeepSeek
  • Свежесть линейкиDeepSeek
  • Порог входа по железуLlama
  • Размер сообщества и совместимостьLlama
  • Готовый сервис от вендораDeepSeek
  • ЛицензияDeepSeek
  • Понимание изображений локальноLlama

DeepSeek свежее — V4 вышла в апреле 2026, тогда как последняя открытая Llama датирована апрелем 2025, — и у него есть бесплатный чат, приложение и дешёвый официальный API, которых у Llama нет вовсе. Llama берёт другим: в семействе есть модели на 1B и 3B, работающие на обычном ноутбуке, её формат стал стандартом для llama.cpp и Ollama, а Llama 4 и 3.2-Vision принимают изображения локально — API DeepSeek картинки на вход не берёт.

Llama VS Qwen
  • Свежесть открытой линейкиQwen
  • ЛицензияQwen
  • Порог скачиванияQwen
  • Русский языкQwen
  • Собственный сервис вендораQwen
  • Размер экосистемы производных моделейLlama
  • Модели «для ноутбука»Ничья

Здесь Llama проигрывает почти по всем строкам: открытая линейка Qwen обновлялась в апреле 2026 и выходит под Apache 2.0 без порога по выручке и без обязательной атрибуции, репозитории скачиваются без анкеты, а русский заявлен явно. За Llama остаётся размер экосистемы: её формат — стандарт для локальных движков, а число дообученных производных больше, чем у любого другого открытого семейства.

Последнее в Журнале

Все материалы

Llama в Журнале пока не разбирали отдельным материалом. Новости о моделях, ценах и доступности появятся здесь сразу после публикации.

Вопросы и ответы

Сколько стоит Llama?+

Нисколько: веса скачиваются бесплатно и без ограничения по времени. Деньги появляются только там, где вы платите за вычисления — стороннему облачному хостеру или за собственное железо.

Есть ли у Llama официальный чат или приложение?+

Нет. Отдельного чата и мобильного приложения у семейства не существует — это модели, а не сервис. Попробовать без установки можно только через сторонние площадки.

Поддерживает ли Llama русский язык?+

Официально нет. В списке поддержанных языков четвёртой линейки двенадцать позиций, русского среди них нет; у Llama 3.3 их восемь, тоже без русского. Модель может отвечать по-русски, но эта работа не гарантирована.

Какая модель запустится на обычном ноутбуке?+

Llama 3.2 3B: сборка весит около 2 ГБ и работает на 8–16 ГБ оперативной памяти. Есть и версия на 1 млрд параметров — 1,3 ГБ. Четвёртая линейка требует серверного железа.

Можно ли использовать Llama в коммерческом продукте?+

Да. Лицензия разрешает коммерческое использование, дообучение и дистилляцию. Условий два: отдельное разрешение нужно только продуктам с аудиторией свыше 700 миллионов активных пользователей в месяц, а при распространении требуется приложить копию лицензии и заметно указать «Built with Llama».

Правда ли, что контекст у Llama 4 — 10 миллионов токенов?+

Это заявленная цифра для Scout из официальной карточки модели. Практически доступный контекст задаёт тот, кто модель разворачивает: один из публичных хостеров, например, отдаёт 327 680 токенов.

Нужен ли VPN, чтобы скачать веса?+

Нет: и страница загрузки, и Hugging Face с российских адресов открываются. Но официальный доступ к репозиториям выдаётся по заявке — нужен аккаунт, принятие лицензии и анкета с именем, датой рождения и названием организации.

Отзывы

Будьте первым, кто оставит отзыв.

Оставить отзыв

Отзывы проходят ручную модерацию: публикуем только осмысленные, без рекламы и накрутки.