Small Language Models

small language models (slm) — компактные модели для устройств

Раздел
Языковые модели
Сокращ.
SLM
Обновлено
18.05.26

Small Language Models (SLM) — компактные LLM до ~10 миллиардов параметров, которые запускаются на ноутбуке или телефоне, часто без интернета. Phi-4 от Microsoft, Gemma 3 от Google, Llama 3.2 от Meta, Qwen 3 от Alibaba — к 2026 по качеству близки к GPT-3.5 в узких задачах. Главное преимущество — приватность, низкая стоимость, оффлайн-режим. Главный тренд: «не каждой задаче нужен GPT-5».

Коротко

Коротко. Small Language Models (SLM) — компактные LLM от ~1 до ~10 миллиардов параметров, запускающиеся локально (на ноутбуке, телефоне, embedded-устройстве). К 2026 — стали по качеству сравнимы с GPT-3.5 в узких задачах. Главные представители: Phi-4 (Microsoft, ~14B), Gemma 3 (Google, 1B–27B), Llama 3.2 (Meta, 1B/3B), Qwen 3 (Alibaba, 0.5B–32B), Mistral Small. Главные плюсы: приватность данных, оффлайн-режим, низкая цена, низкая latency.

Что это такое

Гонка 2022-2023 была за размер: «больше параметров = умнее». GPT-4, Gemini Ultra, Claude Opus — сотни миллиардов до триллионов параметров. К 2024-2025 случился разворот: оказалось, что на правильно собранных данных маленькая модель может быть почти такой же умной для большинства практических задач.

К 2026 — главные SLM:

  • Microsoft Phi-4 (~14B) — флагман Microsoft Research для small language models. Обучен на «качественных учебниках».
  • Google Gemma 3 (1B, 4B, 12B, 27B) — open-source, базируется на технологиях Gemini.
  • Meta Llama 3.2 (1B, 3B) — мобильные SLM от Meta, заточены под телефоны.
  • Alibaba Qwen 3 (0.5B, 1.5B, 7B, 14B, 32B) — открытая китайская линейка.
  • Mistral Small 3 (~24B) — европейский игрок.
  • Apple Intelligence (~3B) — встроена в iOS/macOS.

Главные сценарии:

  • На устройстве пользователя. Apple Intelligence в iPhone, AI-ассистенты в Android, локальные ChatGPT-подобные приложения для Windows/macOS.
  • Edge-инфраструктура. Промышленные приборы, медицинское оборудование, авто.
  • Корпоративные чувствительные данные. Юристы, банки, медицина — данные не уходят в облако.
  • Cost-efficiency. Где OpenAI API стоил бы $10K/мес, локальная Phi-4 — $0 (после железа).
  • Low-latency. Голосовые ассистенты, real-time агенты.

Как это работает

SLM — это архитектурно те же transformer-модели, что и большие LLM. Разница в трёх вещах:

  1. Размер. 1B–14B параметров vs 70B–1T у больших.
  2. Обучение на качестве, не количестве. Например, Phi обучена на «синтетических учебниках» — отфильтрованных, переписанных AI текстах высокого качества (вместо «всего интернета»). Меньше токенов, но лучше отдача.
  3. Distillation. Многие SLM «знают» большие модели — обучаются имитировать GPT-4 или Claude в узкой области.

Как запустить SLM:

  • Ollama — самый простой инсталлер для Mac/Windows/Linux. Один command-запуск.
  • LM Studio — GUI для ноутбука, выбор моделей из каталога.
  • llama.cpp — нативная C++-реализация, запускает на CPU.
  • MLX — фреймворк от Apple для M1/M2/M3, оптимизирован под Metal.
  • transformers.js — запуск прямо в браузере через WebAssembly.
  • Apple Intelligence — встроено в iOS, без install.

Hardware-требования:

  • 1B-3B (Llama 3.2, Gemma 3 1B/4B): работают на телефоне (Android flagship, iPhone 15+) или старом ноутбуке. ~1-4GB RAM.
  • 7B-14B (Phi-4, Llama 3 8B, Mistral 7B): ноутбук с 16GB RAM, или GPU с 8-16GB VRAM. Удобный размер для домашнего использования.
  • 27B-32B (Gemma 3 27B, Qwen 3 32B): требует GPU с 24GB+ VRAM (RTX 4090) или Apple Silicon с 64GB unified memory.

Пример на практике

Юридическая фирма работает с конфиденциальными документами клиентов. Не может отправлять их в OpenAI/Anthropic (нарушение NDA).

Решение через SLM:

# Phi-4 локально через Ollama
from ollama import Client

client = Client(host='http://localhost:11434')

contract = open("contract.pdf.txt").read()  # на сервере фирмы

response = client.chat(
    model='phi4',
    messages=[
        {'role': 'system', 'content': 'Ты — юрист. Анализируй договор, ищи риски.'},
        {'role': 'user', 'content': f'Найди потенциальные риски в этом договоре:\n\n{contract}'}
    ]
)

print(response['message']['content'])

Стоимость setup: один сервер с RTX 4090 = $2500. После — ноль за запрос. Production: 100-500 договоров в день, всё локально, никакие данные не утекают. До этого фирма платила $5K/мес за OpenAI API + риск утечки.

В ComfyUI SLM-модели работают через ноды text-generation-webui интеграции. Особенно полезны для автоматизации workflow без облака — например, «генерируй описание для каждой картинки» через локальную модель.

С чем часто путают

  • SLM и LLM — SLM это подкатегория LLM (Large Language Models). Условная граница — около ~10B параметров.
  • SLM и mini-модели от провайдеровGPT-4o-mini, Claude Haiku, Gemini Flash — это облачные «маленькие» модели (по сравнению с flagship). SLM — это локальные маленькие модели.
  • SLM и квантизованные большие моделиквантизация 70B-модели в 4-bit делает её запускаемой на 24GB VRAM, но это всё ещё большая модель. SLM изначально маленькая.
  • Phi и GPT — Phi от Microsoft — open-source SLM-семейство. GPT — флагманы OpenAI.
  • Apple Intelligence и SLM — Apple Intelligence это продукт Apple, использующий smart routing между Apple SLM (~3B) на устройстве и большими облачными моделями (Apple Private Cloud / OpenAI/Anthropic).

Частые ошибки и заблуждения

  • «SLM — это для бедных». Нет. Многие production-задачи (классификация, простой Q&A) лучше делать на SLM — дешевле, быстрее, не зависит от облака.
  • «SLM глупее GPT-4». В универсальных задачах — да. В узкой задаче после fine-tune — часто на уровне или лучше.
  • «SLM работают на любом железе». 1B-3B — да, почти на всём. 14B — нужен ноутбук с приличным GPU/RAM. 32B — серьёзная workstation.
  • «SLM = open-source». Не всегда. Apple Intelligence SLM — closed. Большинство — open (Phi, Gemma, Llama, Qwen, Mistral).
  • «Это новая категория». Нет, SLM существовали всегда. Изменилось то, что их качество к 2024-2026 догнало уровень, достаточный для production.

Связанные термины

  • LLM — общая категория, SLM — её подкласс.
  • Quantization — техника, через которую SLM ужимаются ещё сильнее (для запуска на телефонах).
  • Fine-tuning — SLM часто кастомизируют под узкую задачу.
  • Edge AI — основная среда, в которой работают SLM.
  • Open-source AI — большинство SLM — открытые модели.

Частые вопросы

Какая SLM лучшая в 2026? Зависит от размера и задачи. Phi-4 — для качества/универсальности. Gemma 3 — для интеграции с Google-стеком. Qwen 3 — для китайского/мультиязычности. Llama 3.2 — для мобильных.

Можно ли запустить на телефоне? Да. Apple Intelligence (iOS 18+), Llama 3.2 1B/3B через приложения, Gemma 3 1B. Скорость — десятки токенов/сек.

Нужно ли интернет? После загрузки модели — нет. Полностью оффлайн. Это и главное преимущество.

Сколько стоит запустить? SLM — бесплатно (если железо есть). Apple Intelligence — встроено в устройства. Облачные mini-модели (GPT-4o-mini, Haiku) — copy-cents за токен.

Заменят ли SLM большие LLM? Не заменят. Дополнят. Большие — для сложных задач (research, coding agents, complex reasoning). SLM — для массовых простых (autocomplete, простой Q&A, voice assistant).

Главное

Small Language Models (SLM) — компактные LLM от 1 до ~14 миллиардов параметров, запускающиеся локально на ноутбуке, телефоне или embedded-устройстве. К 2026 — Phi-4, Gemma 3, Llama 3.2, Qwen 3, Apple Intelligence — по качеству в узких задачах догнали GPT-3.5. Главные плюсы: приватность данных, оффлайн-режим, низкая стоимость, низкая latency. Главные сценарии: на-устройстве AI (iPhone, Android), edge-инфраструктура, чувствительные корпоративные данные, cost-efficient production. Запуск — через Ollama, LM Studio, MLX, llama.cpp. Главный сдвиг 2024-2026: «не каждой задаче нужен GPT-5» — для большинства бытовых и многих бизнес-задач локальная SLM достаточно умна, бесплатна и приватна.