База
LLM (Large Language Model) – это мощная нейросеть, обученная на гигантских объёмах текстовых данных и способная решать задачи естественной обработки языка (генерация текста, ответ на вопросы, кодогенерация и др.).
В данной памятке приведён обзор самых актуальных мультимодальных моделей ИИ, сервисов-агрегаторов, локальных решений и рекомендаций по их безопасному использованию.
У каждой модели есть такой параметр, как контекстное окно – это максимальное количество токенов, которое модель может обработать в одном запросе, включая входные данные (ваш запрос, историю диалога, загруженные документы) и выходной ответ. Чем больше контекстное окно – тем больше информации модель может «помнить» и анализировать в рамках одной сессии.
Токен – это минимальная единица текста, которую обрабатывает языковая модель. Токеном может быть слово, часть слова, символ или даже отдельный знак препинания. В среднем 1 токен ≈ ¾ слова (или ~4 символа) на английском языке; для русского языка соотношение схожее.
Топ Мультимодальных Моделей
Мультимодальная модель (Multimodal AI Model) – это искусственный интеллект, способный одновременно воспринимать, обрабатывать и генерировать информацию в нескольких форматах (модальностях): текст, изображения, аудио, видео, код и другие типы данных
GPT-5
CloudСамая продвинутая версия GPT от OpenAI, выпущенная в 2025 г. Объединяет текстовое, кодовое и визуальное понимание, умеет генерацию изображений и видео.
- Передовые результаты в программировании, математике, медицине
- Режим «быстрого» ответа и «глубокого мышления»
- Улучшенная точность и сниженное число галлюцинаций
Gemini
CloudОблачная мультимодальная модель от Google. Обучена «из коробки» на разных типах данных: текст, код, изображения, аудио и видео.
- Варианты: Ultra, Pro
- State-of-the-art результаты по логике
- Отличная многозадачность и генерация кода
Grok
CloudЧат-бот с «харизмой» от xAI (И. Маска). Доступен в приложениях X (Twitter) и standalone.
- Понимает и генерирует текст, изображения, видео
- Голосовой ввод/вывод
- «Шутливый» стиль ответов
- Доступ к данным в реальном времени
Claude
CloudФлагманская модель от Anthropic, известная безопасностью и точностью. Claude 4.6 Opus/4.5 Sonnet — одни из лучших для кодинга и анализа.
- Превосходное понимание контекста и нюансов
- Минимальные галлюцинации
- Отличные способности к анализу документов
- Claude Code - для разработки
Qwen
OpenСемейство открытых моделей из Китая (Alibaba Cloud). Включает текстовые и мультимодальные варианты (Qwen-VL, Qwen-Audio, Qwen-Omni).
- Модели до 1 трлн параметров
- «Гибридный» режим размышления
- Поддержка 100+ языков
DeepSeek
OpenПроект китайского стартапа с открытыми моделями MoE.
DeepSeek-V3 – гигантская MoE-модель (671B параметров, 37B активных).
- Пропускная способность ~60 токенов/с (онлайн/API)
- Свободно доступна на GitHub (лучше подождать версию - V4)
- Обещают мультимодальные расширения
- Модели до 1 трлн параметров
Kimi
OpenНовейшая открытая модель от Moonshot AI (K2-серия). MoE-модели с порядка 1 трлн параметров (32B активных).
- Нативная мультимодальность
- «Интеллектуальный рой» из агентов
- Оптимизирована для кодинга
ЯндексGPT
CloudРоссийская LLM от Яндекс. YandexGPT 5 с облегчённой версией Lite с открытым исходным кодом.
- Мультиязычность с акцентом на русский язык
- Интеграция с Алисой и продуктами Яндекс
- Возможности генерации изображений и видео
GigaChat
CloudРоссийский многофункциональный ИИ от Сбербанк. Запущен в 2023 году.
- Генерация изображений (Kandinsky)
- Распознавание объектов (ruCLIP)
- Создание музыки
Сравнение Моделей
Контекстное окно определяет максимальное количество токенов, которое модель может обработать в одном запросе (включая входные данные и выходной ответ). Чем больше окно — тем больше информации модель может «помнить» в рамках одной сессии.
| Модель | Мультимодальность | Контекст | Форматы | Память/Требования | Ссылка |
|---|---|---|---|---|---|
| GPT-5 | Текст + Изображение + Видео | 400K | Проприетарная (API) | Облачная система Локальная: oss-gpt-120B () |
🔗 OpenAI |
| Gemini | Текст, Код, Изображение, Аудио, Видео | 1M–2M | Проприетарная (API) | Облачная (Google Cloud) | |
| Grok | Текст, Изображение, Видео | 256K–2M | Проприетарная (API) | Облачная (X.ai) | 🔗 xAI |
| Claude | Текст, Изображение, Код | 200K–1M | Проприетарная (API) | Облачная (Anthropic) | 🔗 Anthropic |
| Qwen | Текст, Изображение, Аудио | 256K–1M | GGUF, MLX | Облачная (Alibaba) Локальная: от 9B (~16-18 GB (FP16), ~5-8 GB (4-бит)) |
🔗 Alibaba |
| DeepSeek | Текст | 128K | Open-source (PyTorch) | Облачная (DeepSeek) Локальная: 37B: от 32Gb RAM |
🔗 DeepSeek |
| Kimi | Текст, Изображение, Код | 128K–256K | Open-source (MoE) | ~1T параметров (32B активных, но локально - нужен сервер | 🔗 Moonshot |
| YandexGPT | Текст (с vision-модулями) | 32K | Проприетарная (API) | Облачная (во всех продуктах Яндекс) | 🔗 Yandex |
| GigaChat | Текст + Изображение + Аудио | 131K | Проприетарная (API) | Облачная (в продуктах Sber) | 🔗 Sber |
Сервисы-Агрегаторы ИИ
Сервисы-агрегаторы позволяют в одном интерфейсе обращаться к разным нейросетям без лишних настроек и множественных подписок.
Syntx.ai
Универсальная платформа для 90+ AI-инструментов в едином интерфейсе.
Возможности: текст, изображения, видео, аудио в одном дашборде. Экономия до 80% на подписках.
Chad.ai
Русскоязычный агрегатор чат-ботов с поддержкой множества моделей.
Возможности: адаптация ChatGPT на русском, работает без VPN, генерация текста и изображений.
Perplexity
Конверсационный поисковый движок с веб-подтверждёнными ответами.
Возможности: глубокий анализ документов, интеграция живых данных из веба, до 128K токенов контекста.
GenSpark
Универсальное AI-рабочее пространство с 20+ интегрированными функциями.
Возможности: автономные супер-агенты, создание презентаций, документов, видео и кода в одном месте.
Weavy
Профессиональная дизайн-платформа с узловым интерфейсом для AI-генерации.
Возможности: комбинация разных AI-моделей, профессиональное редактирование, ветвление результатов. Приобретён Figma.
Krea
Платформа для генерации изображений в реальном времени с 64+ AI-моделями.
Возможности: генерация в реальном времени, upscaling до 22K, in/out-painting, стиль-трансфер.
Локальные Менеджеры
LM Studio
DesktopКроссплатформенный десктоп (Windows/Linux/macOS) для запуска LLM локально.
- Загрузка открытых моделей (gpt-oss, Qwen3, Gemma3, DeepSeek)
- Графический интерфейс
- API-интерфейс для программной работы
- Бесплатен для домашнего и коммерческого использования
Ограничение: Зависит от ресурсов ПК, для больших моделей требуется много памяти/GPU.
Ollama
CLIЛокальное окружение (CLI) для M1–M4 Mac, Windows и Linux.
- Интерактивное меню для запуска чатов
- Доступ к агентам (OpenClaw и др.)
- Поддержка открытых моделей
- Все вычисления локально
Недостаток: Требуются навыки терминала и мощное «железо».
ComfyUI
Node-basedУзловая платформа для создания рабочих процессов генерации AI-изображений.
- Полный контроль над процессом генерации
- Поддержка множественных моделей (Stable Diffusion, Flux и др.)
- ComfyUI Manager для управления расширениями
- Локальная работа без облака
Особенность: Визуальное программирование рабочих потоков, максимальная гибкость.
Все менеджеры не имеют встроенного доступа в интернет – модели работают оффлайн, данные пользователя не передаются на внешние сервера.
Главное ограничение – вычислительные ресурсы: большие модели требуют много оперативной/графической памяти.
LM Studio — Подробное Руководство
LM Studio — это кроссплатформенное десктопное приложение (Windows/Linux/macOS) для локального запуска больших языковых моделей (LLM) без необходимости подключения к интернету.
Возможности LM Studio
- Поиск и загрузка моделей: встроенный каталог с прямым доступом к HuggingFace — тысячи моделей в формате GGUF
- Графический интерфейс: удобный чат-интерфейс без необходимости работы с командной строкой
- API-сервер: локальный сервер совместимый с OpenAI API для интеграции с другими приложениями
- Поддержка форматов: GGUF, MLX (для Apple Silicon), квантованные модели (Q4, Q8 и др.)
- Мульти-модельность: возможность переключения между разными моделями без перезапуска
- Полная приватность: все вычисления происходят локально, данные не передаются на внешние серверы
- Бесплатное использование: бесплатно для домашнего и коммерческого использования
- Настройка параметров: контроль температуры, контекста, количества токенов и других параметров генерации
Системные Требования
📊 Требования к памяти для моделей:
- 7B модель (4-bit): ~5-6 GB RAM
- 13B модель (4-bit): ~8-10 GB RAM
- 30B модель (4-bit): ~18-20 GB RAM
- 70B модель (4-bit): ~40-45 GB RAM
Пошаговая Инструкция по Настройке
1 Скачать и Установить
Перейдите на официальный сайт lmstudio.ai и скачайте версию для вашей операционной системы (Windows, macOS или Linux).
Установите приложение стандартным способом — никаких дополнительных настроек не требуется.
2 Настроить Русский Язык
LM Studio автоматически определяет язык системы. Если интерфейс на английском:
- Откройте Settings (⚙️ в левом нижнем углу)
- Найдите раздел Appearance или Language
- Выберите Russian / Русский (если доступно)
- Перезапустите приложение
💡 Примечание: Даже с английским интерфейсом модели прекрасно понимают и генерируют русский текст — нужно просто писать запросы на русском языке.
3 Скачать Первую Модель
В левой панели нажмите на иконку 🔍 Search (Поиск моделей).
В строке поиска введите название модели. Для начала рекомендую:
🚀 Для быстрых ответов
Qwen3.5 9B
~6 GB, быстро работает
⚖️ Баланс
Qwen3.5 35B A3B (Q4_K_M)
~20 GB, универсальная
🇷🇺 Для серьёзных проектов
Qwen3.5 122B A10B
~78Gb - MacBook потянет
Все представленные модели 2026 года, мульмодальные - умеют работать с тестом и изображениями!
Важно: Выбирайте версию с квантованием Q4_K_M или Q5_K_M — это оптимальный баланс качества и размера.
Нажмите Download рядом с выбранной моделью. Дождитесь загрузки (может занять 5-30 минут в зависимости от скорости интернета).
4 Загрузить Модель
Перейдите в раздел 💬 Chat (Чат) в левой панели.
В верхней части окна нажмите на выпадающий список "Select a model to load" и выберите скачанную модель из списка.
Модель начнёт загружаться в оперативную память — вы увидите индикатор прогресса. После загрузки статус изменится на "Ready" (Готово).
5 Начать Использовать
В поле ввода сообщения напишите ваш запрос на русском языке, например:
Привет! Расскажи мне о преимуществах локальных ИИ-моделей.
Нажмите Enter или кнопку отправки. Модель сгенерирует ответ в течение нескольких секунд.
- Temperature: Я использую 0.1-0.4 для большей точности, для большей креативности - повышаем
- Max Context Length: Можно выкручивать на максимум - 262 000 токенов (поскольку у Вас 128Gb RAM)
- System Prompt: можно задать роль модели, например: «Ты полезный ассистент, отвечающий на русском языке», но лучше дать более развёрнутую характеристику
6 Дополнительные Возможности
🔌 Локальный API-сервер
В разделе ↔️ Local Server можно запустить сервер, совместимый с OpenAI API. Это позволяет подключать LM Studio к другим приложениям (VS Code, Obsidian и др.).
URL: http://localhost:1234/v1
📁 Управление моделями
В разделе 📂 My Models можно просматривать скачанные модели, удалять ненужные и освобождать место на диске.
Путь к файлам: ~/.cache/lm-studio/models
Рекомендации
- Начинайте с малых моделей (7B-9B) для знакомства с интерфейсом
- Большие модели 6-5-4-битное квантование (что это см. ниже) для экономии памяти, но для серьёзной работы я предпочитаю брать модели Q8
- Регулярно обновляйте LM Studio до последней версии
- Скачивайте модели только из встроенного каталога (прямо через поиск в LM Studio)
- Для русского языка ищите модели с пометкой «Instruct» или «RU», но Qwen - любые работают с русским языком
- Закрывайте приложение полностью, когда не используете — модели занимают RAM
Возможные Проблемы
- Модель не загружается: проверьте наличие свободной RAM (закройте другие программы)
- Медленная генерация: выберите модель меньшего размера или более агрессивное квантование (Q3, Q4)
- «Бесконечный» вывод: ограничьте Max Tokens в настройках (с тяжёлыми моделями - может играть роль)
- Плохое качество ответов: попробуйте другую модель или настройте Temperature ниже (0.2-0.3)
- Не работает на русском: убедитесь, что модель поддерживает русский (ищите в описании на HuggingFace)
🔗 Полезные Ресурсы
Форматы и Квантование
GGUF
Бинарный формат от llama.cpp для локальных LLM.
Хранит веса и метаданные оптимально для быстрого чтения и инференса.
Используют: LM Studio, Ollama, GPT4All, llama.cpp
MLX
Новый формат Apple Metal для M1–M4 устройств.
Поддерживает 4‑битное квантование моделей.
Пакеты: .mlx (text-only), mlx-vlm (vision+text)
Квантование
Сжатие модели по точности (8‑, 4‑бит), что уменьшает размер и требования к ОЗУ.
Пример: Qwen3-8B в FP16 ≈ 16-18 GB, в 4-бит ≈ 5-8 GB
Квантование — это процесс сжатия нейросетевой модели за счёт снижения разрядности её весов (например, с 16 бит до 4 или 8 бит), что значительно уменьшает размер файла и требования к оперативной памяти. Например, модель Qwen3-8B в формате FP16 занимает ~16–18 GB памяти, а после 4-битного квантования — всего ~5–8 GB. Это позволяет запускать большие модели на устройствах с ограниченными ресурсами (например, на MacBook с 16–32 GB RAM). Потеря качества при этом минимальна — модель сохраняет большую часть своих способностей, хотя может работать немного медленнее. Популярные форматы квантования включают Q4_K_M, Q5_K_M, Q8_0 и используются в GGUF и MLX..
| Формат | Описание | Квантование | Применение |
|---|---|---|---|
| GGUF | Бинарный формат llama.cpp | Q4/Q8 и т.д. | LM Studio, Ollama, llama.cpp |
| MLX | Apple Metal для M-серии | Q4_0, Q4_1, Q8_0 | macOS (M1–M4) |
| Quantize | Снижение разрядности весов | Снижает ОЗУ в ~3-4× | Локальный запуск |
Для MacBook M4 Max (128 GB)
На современных Mac M4 Max (128 GB unified RAM) можно запускать большие модели локально. Особенно подходят модели с открытыми весами, оптимизированные под квантование.
Qwen3
8B версия: FP16 ≈ 16-18 GB, 4-bit ≈ 5-8 GB
30B-A3B: ≈ 32 GB RAM + 8 GB видеопамяти
Контекст: 256K токенов
Производительность: ~72-102 токена/с
Форматы: GGUF, MLX
Qwen3.5
Малые: 9B, 4B, 2B – 10-20 GB памяти
Большие: 35B-A3B, 27B – ≈ 40 GB
Контекст: 256K–1M токенов
Форматы: GGUF, MLX
Репозиторий: HuggingFace
GPT-OSS
gpt-oss-20b: 21B параметров, 3.6B активных
gpt-oss-120b: 117B, 5.1B активных
Контекст: 131K токенов
Требования: всего 16 GB памяти
Форматы: SafeTensors, GGUF
Рекомендации по настройке
- Оптимальный выбор 4-битное квантование (
Q4_K_Mдля Qwen3) - Запускайте через LM Studio или Ollama
- В Ollama задайте длину контекста (
num_ctx) и токенов (num_predict) - Регулярно обновляйте llama.cpp и движки
- Скачивайте веса с HuggingFace или GitHub QwenLM
Безопасность и Приватность
Рекомендации
- Загрузка из надёжных источников: используйте только официальные репозитории (HuggingFace, GitHub)
- Оффлайн-запуск: локальные модели не имеют доступа в Интернет
- Обновляйте ПО: используйте актуальные версии LM Studio, Ollama
- Проверка целостности: сверяйте контрольные суммы (SHA256)
- Ограничения доступа: не передавайте конфиденциальную информацию
- Шифрование и изоляция: храните модели на зашифрованном диске
Важно помнить
Формат GGUF теоретически может скрывать вредоносный код, поэтому лучше брать модели, проверенные сообществом (HuggingFace сканирует свои файлы).
Локальные LLM по сути «печатающая машинка», но уязвимости могут возникнуть в среде выполнения, особенно при работе с файлами моделей.
Запускать локальный LLM в изолированном окружении (виртуальная машина, sandbox) – дополнительная гарантия.