Small Language Models
small language models (slm) — компактные модели для устройств
Small Language Models (SLM) — компактные LLM до ~10 миллиардов параметров, которые запускаются на ноутбуке или телефоне, часто без интернета. Phi-4 от Microsoft, Gemma 3 от Google, Llama 3.2 от Meta, Qwen 3 от Alibaba — к 2026 по качеству близки к GPT-3.5 в узких задачах. Главное преимущество — приватность, низкая стоимость, оффлайн-режим. Главный тренд: «не каждой задаче нужен GPT-5».
Коротко
Коротко. Small Language Models (SLM) — компактные LLM от ~1 до ~10 миллиардов параметров, запускающиеся локально (на ноутбуке, телефоне, embedded-устройстве). К 2026 — стали по качеству сравнимы с GPT-3.5 в узких задачах. Главные представители: Phi-4 (Microsoft, ~14B), Gemma 3 (Google, 1B–27B), Llama 3.2 (Meta, 1B/3B), Qwen 3 (Alibaba, 0.5B–32B), Mistral Small. Главные плюсы: приватность данных, оффлайн-режим, низкая цена, низкая latency.
Что это такое
Гонка 2022-2023 была за размер: «больше параметров = умнее». GPT-4, Gemini Ultra, Claude Opus — сотни миллиардов до триллионов параметров. К 2024-2025 случился разворот: оказалось, что на правильно собранных данных маленькая модель может быть почти такой же умной для большинства практических задач.
К 2026 — главные SLM:
- Microsoft Phi-4 (~14B) — флагман Microsoft Research для small language models. Обучен на «качественных учебниках».
- Google Gemma 3 (1B, 4B, 12B, 27B) — open-source, базируется на технологиях Gemini.
- Meta Llama 3.2 (1B, 3B) — мобильные SLM от Meta, заточены под телефоны.
- Alibaba Qwen 3 (0.5B, 1.5B, 7B, 14B, 32B) — открытая китайская линейка.
- Mistral Small 3 (~24B) — европейский игрок.
- Apple Intelligence (~3B) — встроена в iOS/macOS.
Главные сценарии:
- На устройстве пользователя. Apple Intelligence в iPhone, AI-ассистенты в Android, локальные ChatGPT-подобные приложения для Windows/macOS.
- Edge-инфраструктура. Промышленные приборы, медицинское оборудование, авто.
- Корпоративные чувствительные данные. Юристы, банки, медицина — данные не уходят в облако.
- Cost-efficiency. Где OpenAI API стоил бы $10K/мес, локальная Phi-4 — $0 (после железа).
- Low-latency. Голосовые ассистенты, real-time агенты.
Как это работает
SLM — это архитектурно те же transformer-модели, что и большие LLM. Разница в трёх вещах:
- Размер. 1B–14B параметров vs 70B–1T у больших.
- Обучение на качестве, не количестве. Например, Phi обучена на «синтетических учебниках» — отфильтрованных, переписанных AI текстах высокого качества (вместо «всего интернета»). Меньше токенов, но лучше отдача.
- Distillation. Многие SLM «знают» большие модели — обучаются имитировать GPT-4 или Claude в узкой области.
Как запустить SLM:
- Ollama — самый простой инсталлер для Mac/Windows/Linux. Один command-запуск.
- LM Studio — GUI для ноутбука, выбор моделей из каталога.
- llama.cpp — нативная C++-реализация, запускает на CPU.
- MLX — фреймворк от Apple для M1/M2/M3, оптимизирован под Metal.
- transformers.js — запуск прямо в браузере через WebAssembly.
- Apple Intelligence — встроено в iOS, без install.
Hardware-требования:
- 1B-3B (Llama 3.2, Gemma 3 1B/4B): работают на телефоне (Android flagship, iPhone 15+) или старом ноутбуке. ~1-4GB RAM.
- 7B-14B (Phi-4, Llama 3 8B, Mistral 7B): ноутбук с 16GB RAM, или GPU с 8-16GB VRAM. Удобный размер для домашнего использования.
- 27B-32B (Gemma 3 27B, Qwen 3 32B): требует GPU с 24GB+ VRAM (RTX 4090) или Apple Silicon с 64GB unified memory.
Пример на практике
Юридическая фирма работает с конфиденциальными документами клиентов. Не может отправлять их в OpenAI/Anthropic (нарушение NDA).
Решение через SLM:
# Phi-4 локально через Ollama
from ollama import Client
client = Client(host='http://localhost:11434')
contract = open("contract.pdf.txt").read() # на сервере фирмы
response = client.chat(
model='phi4',
messages=[
{'role': 'system', 'content': 'Ты — юрист. Анализируй договор, ищи риски.'},
{'role': 'user', 'content': f'Найди потенциальные риски в этом договоре:\n\n{contract}'}
]
)
print(response['message']['content'])
Стоимость setup: один сервер с RTX 4090 = $2500. После — ноль за запрос. Production: 100-500 договоров в день, всё локально, никакие данные не утекают. До этого фирма платила $5K/мес за OpenAI API + риск утечки.
В ComfyUI SLM-модели работают через ноды text-generation-webui интеграции. Особенно полезны для автоматизации workflow без облака — например, «генерируй описание для каждой картинки» через локальную модель.
С чем часто путают
- SLM и LLM — SLM это подкатегория LLM (Large Language Models). Условная граница — около ~10B параметров.
- SLM и mini-модели от провайдеров — GPT-4o-mini, Claude Haiku, Gemini Flash — это облачные «маленькие» модели (по сравнению с flagship). SLM — это локальные маленькие модели.
- SLM и квантизованные большие модели — квантизация 70B-модели в 4-bit делает её запускаемой на 24GB VRAM, но это всё ещё большая модель. SLM изначально маленькая.
- Phi и GPT — Phi от Microsoft — open-source SLM-семейство. GPT — флагманы OpenAI.
- Apple Intelligence и SLM — Apple Intelligence это продукт Apple, использующий smart routing между Apple SLM (~3B) на устройстве и большими облачными моделями (Apple Private Cloud / OpenAI/Anthropic).
Частые ошибки и заблуждения
- «SLM — это для бедных». Нет. Многие production-задачи (классификация, простой Q&A) лучше делать на SLM — дешевле, быстрее, не зависит от облака.
- «SLM глупее GPT-4». В универсальных задачах — да. В узкой задаче после fine-tune — часто на уровне или лучше.
- «SLM работают на любом железе». 1B-3B — да, почти на всём. 14B — нужен ноутбук с приличным GPU/RAM. 32B — серьёзная workstation.
- «SLM = open-source». Не всегда. Apple Intelligence SLM — closed. Большинство — open (Phi, Gemma, Llama, Qwen, Mistral).
- «Это новая категория». Нет, SLM существовали всегда. Изменилось то, что их качество к 2024-2026 догнало уровень, достаточный для production.
Связанные термины
- LLM — общая категория, SLM — её подкласс.
- Quantization — техника, через которую SLM ужимаются ещё сильнее (для запуска на телефонах).
- Fine-tuning — SLM часто кастомизируют под узкую задачу.
- Edge AI — основная среда, в которой работают SLM.
- Open-source AI — большинство SLM — открытые модели.
Частые вопросы
Какая SLM лучшая в 2026? Зависит от размера и задачи. Phi-4 — для качества/универсальности. Gemma 3 — для интеграции с Google-стеком. Qwen 3 — для китайского/мультиязычности. Llama 3.2 — для мобильных.
Можно ли запустить на телефоне? Да. Apple Intelligence (iOS 18+), Llama 3.2 1B/3B через приложения, Gemma 3 1B. Скорость — десятки токенов/сек.
Нужно ли интернет? После загрузки модели — нет. Полностью оффлайн. Это и главное преимущество.
Сколько стоит запустить? SLM — бесплатно (если железо есть). Apple Intelligence — встроено в устройства. Облачные mini-модели (GPT-4o-mini, Haiku) — copy-cents за токен.
Заменят ли SLM большие LLM? Не заменят. Дополнят. Большие — для сложных задач (research, coding agents, complex reasoning). SLM — для массовых простых (autocomplete, простой Q&A, voice assistant).
Главное
Small Language Models (SLM) — компактные LLM от 1 до ~14 миллиардов параметров, запускающиеся локально на ноутбуке, телефоне или embedded-устройстве. К 2026 — Phi-4, Gemma 3, Llama 3.2, Qwen 3, Apple Intelligence — по качеству в узких задачах догнали GPT-3.5. Главные плюсы: приватность данных, оффлайн-режим, низкая стоимость, низкая latency. Главные сценарии: на-устройстве AI (iPhone, Android), edge-инфраструктура, чувствительные корпоративные данные, cost-efficient production. Запуск — через Ollama, LM Studio, MLX, llama.cpp. Главный сдвиг 2024-2026: «не каждой задаче нужен GPT-5» — для большинства бытовых и многих бизнес-задач локальная SLM достаточно умна, бесплатна и приватна.