📚 Памятка для начинающих 

LLM и Мультимодальные Модели ИИ

Обзор самых актуальных моделей, сервисов-агрегаторов, локальных решений и рекомендаций по безопасному использованию

База 

LLM (Large Language Model) – это мощная нейросеть, обученная на гигантских объёмах текстовых данных и способная решать задачи естественной обработки языка (генерация текста, ответ на вопросы, кодогенерация и др.).

В данной памятке приведён обзор самых актуальных мультимодальных моделей ИИ, сервисов-агрегаторов, локальных решений и рекомендаций по их безопасному использованию.

У каждой модели есть такой параметр, как контекстное окно – это максимальное количество токенов, которое модель может обработать в одном запросе, включая входные данные (ваш запрос, историю диалога, загруженные документы) и выходной ответ. Чем больше контекстное окно – тем больше информации модель может «помнить» и анализировать в рамках одной сессии.

Токен – это минимальная единица текста, которую обрабатывает языковая модель. Токеном может быть слово, часть слова, символ или даже отдельный знак препинания. В среднем 1 токен ≈ ¾ слова (или ~4 символа) на английском языке; для русского языка соотношение схожее.

9+
Топовых моделей
6
Агрегаторов
3
Менеджера
2M
Макс. контекст

Топ Мультимодальных Моделей

Мультимодальная модель (Multimodal AI Model) – это искусственный интеллект, способный одновременно воспринимать, обрабатывать и генерировать информацию в нескольких форматах (модальностях): текст, изображения, аудио, видео, код и другие типы данных

GPT-5

Cloud

Самая продвинутая версия GPT от OpenAI, выпущенная в 2025 г. Объединяет текстовое, кодовое и визуальное понимание, умеет генерацию изображений и видео.

  • Передовые результаты в программировании, математике, медицине
  • Режим «быстрого» ответа и «глубокого мышления»
  • Улучшенная точность и сниженное число галлюцинаций
Контекст
400K токенов
Вывод (за раз)
128K токенов
Формат
API

→ openai.com

💎

Gemini

Cloud

Облачная мультимодальная модель от Google. Обучена «из коробки» на разных типах данных: текст, код, изображения, аудио и видео.

  • Варианты: Ultra, Pro
  • State-of-the-art результаты по логике
  • Отличная многозадачность и генерация кода
Контекст
1M–2M токенов
ЭКОСИСТЕМА
комплекс ИИ-решений  
Формат
API

→ gemini.google.com

🚀

Grok

Cloud

Чат-бот с «харизмой» от xAI (И. Маска). Доступен в приложениях X (Twitter) и standalone.

  • Понимает и генерирует текст, изображения, видео
  • Голосовой ввод/вывод
  • «Шутливый» стиль ответов
  • Доступ к данным в реальном времени
Контекст
256K–2M токенов
Вывод
8K токенов
Формат
API

→ x.ai/grok

🟠

Claude

Cloud

Флагманская модель от Anthropic, известная безопасностью и точностью. Claude 4.6 Opus/4.5 Sonnet — одни из лучших для кодинга и анализа.

  • Превосходное понимание контекста и нюансов
  • Минимальные галлюцинации
  • Отличные способности к анализу документов
  • Claude Code - для разработки
Контекст
200K–1M токенов
Варианты
Sonnet/Opus
Формат
API

→ claude.com

☁️

Qwen

Open

Семейство открытых моделей из Китая (Alibaba Cloud). Включает текстовые и мультимодальные варианты (Qwen-VL, Qwen-Audio, Qwen-Omni).

  • Модели до 1 трлн параметров
  • «Гибридный» режим размышления
  • Поддержка 100+ языков
Контекст
256K–1M токенов
Языки
100+
Формат
API/GGUF/MLX

→ chat.qwen.ai

🔍

DeepSeek

Open

Проект китайского стартапа с открытыми моделями MoE. 

DeepSeek-V3 – гигантская MoE-модель (671B параметров, 37B активных).

  • Пропускная способность ~60 токенов/с (онлайн/API)
  • Свободно доступна на GitHub (лучше подождать версию - V4)
  • Обещают мультимодальные расширения
  • Модели до 1 трлн параметров 
Контекст
до 1M токенов
Активные
37B
Формат
API/PyTorch/GGUF/MLX

→ deepseek.com

🌙

Kimi

Open

Новейшая открытая модель от Moonshot AI (K2-серия). MoE-модели с порядка 1 трлн параметров (32B активных).

  • Нативная мультимодальность
  • «Интеллектуальный рой» из агентов
  • Оптимизирована для кодинга
Контекст
128K–256K токенов
Параметры
~1T (32B актив.)
Формат
MoE/API

→ kimik2ai.com

🔴

ЯндексGPT

Cloud

Российская LLM от Яндекс. YandexGPT 5 с облегчённой версией Lite с открытым исходным кодом.

  • Мультиязычность с акцентом на  русский язык
  • Интеграция с Алисой и продуктами Яндекс
  • Возможности генерации  изображений и видео
Контекст
32K токенов
Версии
Lite/Pro
Формат
API

→ alice.yandex.ru

🏦

GigaChat

Cloud

Российский многофункциональный ИИ от Сбербанк. Запущен в 2023 году.

  • Генерация изображений (Kandinsky)
  • Распознавание объектов (ruCLIP)
  • Создание музыки
Контекст
131K токенов
Версии
Lite/Pro
Формат
API

→ giga.chat

Сравнение Моделей

📏 Контекстное окно

Контекстное окно определяет максимальное количество токенов, которое модель может обработать в одном запросе (включая входные данные и выходной ответ). Чем больше окно — тем больше информации модель может «помнить» в рамках одной сессии.

Модель Мультимодальность Контекст Форматы Память/Требования Ссылка
GPT-5 Текст + Изображение + Видео 400K Проприетарная (API)

Облачная система

Локальная: oss-gpt-120B () 

🔗 OpenAI
Gemini Текст, Код, Изображение, Аудио, Видео 1M–2M Проприетарная (API) Облачная (Google Cloud) 🔗 Google
Grok Текст, Изображение, Видео 256K–2M Проприетарная (API) Облачная (X.ai) 🔗 xAI
Claude Текст, Изображение, Код 200K–1M Проприетарная (API) Облачная (Anthropic) 🔗 Anthropic
Qwen Текст, Изображение, Аудио 256K–1M GGUF, MLX Облачная (Alibaba)
Локальная: от 9B (~16-18 GB (FP16), ~5-8 GB (4-бит))
🔗 Alibaba
DeepSeek Текст 128K Open-source (PyTorch) Облачная (DeepSeek)
Локальная: 37B: от 32Gb RAM
🔗 DeepSeek
Kimi Текст, Изображение, Код 128K–256K Open-source (MoE) ~1T параметров (32B активных, но локально - нужен сервер    🔗 Moonshot
YandexGPT Текст (с vision-модулями) 32K Проприетарная (API) Облачная (во всех продуктах Яндекс) 🔗 Yandex
GigaChat Текст + Изображение + Аудио 131K Проприетарная (API) Облачная (в продуктах Sber) 🔗 Sber

Сервисы-Агрегаторы ИИ

💡 Что такое агрегаторы?

Сервисы-агрегаторы позволяют в одном интерфейсе обращаться к разным нейросетям без лишних настроек и множественных подписок.

🎯

Syntx.ai

Универсальная платформа для 90+ AI-инструментов в едином интерфейсе.

ChatGPT Claude Midjourney Sora Flux

Возможности: текст, изображения, видео, аудио в одном дашборде. Экономия до 80% на подписках.

→ syntx.ai

💬

Chad.ai

Русскоязычный агрегатор чат-ботов с поддержкой множества моделей.

GPT Midjourney StableDiffusion Русский

Возможности: адаптация ChatGPT на русском, работает без VPN, генерация текста и изображений.

→ chadgpt.ru

🔍

Perplexity

Конверсационный поисковый движок с веб-подтверждёнными ответами.

Поиск Цитаты Файлы 128K контекст

Возможности: глубокий анализ документов, интеграция живых данных из веба, до 128K токенов контекста.

→ perplexity.ai

GenSpark

Универсальное AI-рабочее пространство с 20+ интегрированными функциями.

Слайды Документы Видео Агенты

Возможности: автономные супер-агенты, создание презентаций, документов, видео и кода в одном месте.

→ genspark.ai

🎨

Weavy

Профессиональная дизайн-платформа с узловым интерфейсом для AI-генерации.

Node-based Изображения Видео 3D

Возможности: комбинация разных AI-моделей, профессиональное редактирование, ветвление результатов. Приобретён Figma.

→ weavy.ai

Krea

Платформа для генерации изображений в реальном времени с 64+ AI-моделями.

Real-time Upscaling Flux 22K

Возможности: генерация в реальном времени, upscaling до 22K, in/out-painting, стиль-трансфер.

→ krea.ai

Локальные Менеджеры

🖥️

LM Studio

Desktop

Кроссплатформенный десктоп (Windows/Linux/macOS) для запуска LLM локально.

  • Загрузка открытых моделей (gpt-oss, Qwen3, Gemma3, DeepSeek)
  • Графический интерфейс
  • API-интерфейс для программной работы
  • Бесплатен для домашнего и коммерческого использования

Ограничение: Зависит от ресурсов ПК, для больших моделей требуется много памяти/GPU.

→ lmstudio.ai

⌨️

Ollama

CLI

Локальное окружение (CLI) для M1–M4 Mac, Windows и Linux.

  • Интерактивное меню для запуска чатов
  • Доступ к агентам (OpenClaw и др.)
  • Поддержка открытых моделей
  • Все вычисления локально

Недостаток: Требуются навыки терминала и мощное «железо».

→ ollama.com

🔗

ComfyUI

Node-based

Узловая платформа для создания рабочих процессов генерации AI-изображений.

  • Полный контроль над процессом генерации
  • Поддержка множественных моделей (Stable Diffusion, Flux и др.)
  • ComfyUI Manager для управления расширениями
  • Локальная работа без облака

Особенность: Визуальное программирование рабочих потоков, максимальная гибкость.

→ comfyui.org

🔐 Приватность

Все менеджеры не имеют встроенного доступа в интернет – модели работают оффлайн, данные пользователя не передаются на внешние сервера.

Главное ограничение – вычислительные ресурсы: большие модели требуют много оперативной/графической памяти.

LM Studio — Подробное Руководство

🎯 О менеджере

LM Studio — это кроссплатформенное десктопное приложение (Windows/Linux/macOS) для локального запуска больших языковых моделей (LLM) без необходимости подключения к интернету.

Возможности LM Studio

  • Поиск и загрузка моделей: встроенный каталог с прямым доступом к HuggingFace — тысячи моделей в формате GGUF
  • Графический интерфейс: удобный чат-интерфейс без необходимости работы с командной строкой
  • API-сервер: локальный сервер совместимый с OpenAI API для интеграции с другими приложениями
  • Поддержка форматов: GGUF, MLX (для Apple Silicon), квантованные модели (Q4, Q8 и др.)
  • Мульти-модельность: возможность переключения между разными моделями без перезапуска
  • Полная приватность: все вычисления происходят локально, данные не передаются на внешние серверы
  • Бесплатное использование: бесплатно для домашнего и коммерческого использования
  • Настройка параметров: контроль температуры, контекста, количества токенов и других параметров генерации
💻

Системные Требования

ОС
Win 10+/macOS 12+/Linux
RAM (мин.)
8 GB
RAM (рек.)
16-32+ GB
GPU
NVIDIA
GPU
AMD
GPU
Apple Silicon

📊 Требования к памяти для моделей:

  • 7B модель (4-bit): ~5-6 GB RAM
  • 13B модель (4-bit): ~8-10 GB RAM
  • 30B модель (4-bit): ~18-20 GB RAM
  • 70B модель (4-bit): ~40-45 GB RAM
📖

Пошаговая Инструкция по Настройке

1 Скачать и Установить

Перейдите на официальный сайт lmstudio.ai и скачайте версию для вашей операционной системы (Windows, macOS или Linux).

Установите приложение стандартным способом — никаких дополнительных настроек не требуется.

2 Настроить Русский Язык

LM Studio автоматически определяет язык системы. Если интерфейс на английском:

  • Откройте Settings (⚙️ в левом нижнем углу)
  • Найдите раздел Appearance или Language
  • Выберите Russian / Русский (если доступно)
  • Перезапустите приложение

💡 Примечание: Даже с английским интерфейсом модели прекрасно понимают и генерируют русский текст — нужно просто писать запросы на русском языке.

3 Скачать Первую Модель

В левой панели нажмите на иконку 🔍 Search (Поиск моделей).

В строке поиска введите название модели. Для начала рекомендую:

🚀 Для быстрых ответов

Qwen3.5 9B

~6 GB, быстро работает

⚖️ Баланс

Qwen3.5 35B A3B (Q4_K_M)

~20 GB, универсальная

🇷🇺 Для серьёзных проектов

Qwen3.5 122B A10B

~78Gb - MacBook потянет

Все представленные модели 2026 года, мульмодальные - умеют работать с тестом и изображениями!

Важно: Выбирайте версию с квантованием Q4_K_M или Q5_K_M — это оптимальный баланс качества и размера.

Нажмите Download рядом с выбранной моделью. Дождитесь загрузки (может занять 5-30 минут в зависимости от скорости интернета).

4 Загрузить Модель

Перейдите в раздел 💬 Chat (Чат) в левой панели.

В верхней части окна нажмите на выпадающий список "Select a model to load" и выберите скачанную модель из списка.

Модель начнёт загружаться в оперативную память — вы увидите индикатор прогресса. После загрузки статус изменится на "Ready" (Готово).

5 Начать Использовать

В поле ввода сообщения напишите ваш запрос на русском языке, например:

Привет! Расскажи мне о преимуществах локальных ИИ-моделей.

Нажмите Enter или кнопку отправки. Модель сгенерирует ответ в течение нескольких секунд.

⚙️ Настройки генерации (справа в панели)
  • Temperature: Я использую 0.1-0.4 для большей точности, для большей креативности - повышаем
  • Max Context Length: Можно выкручивать на максимум - 262 000 токенов (поскольку у Вас 128Gb RAM)
  • System Prompt: можно задать роль модели, например: «Ты полезный ассистент, отвечающий на русском языке», но лучше дать более развёрнутую характеристику

6 Дополнительные Возможности

🔌 Локальный API-сервер

В разделе ↔️ Local Server можно запустить сервер, совместимый с OpenAI API. Это позволяет подключать LM Studio к другим приложениям (VS Code, Obsidian и др.).

URL: http://localhost:1234/v1

📁 Управление моделями

В разделе 📂 My Models можно просматривать скачанные модели, удалять ненужные и освобождать место на диске.

Путь к файлам: ~/.cache/lm-studio/models

Рекомендации

  • Начинайте с малых моделей (7B-9B) для знакомства с интерфейсом
  • Большие модели 6-5-4-битное квантование (что это см. ниже) для экономии памяти, но для серьёзной работы я предпочитаю брать модели Q8
  • Регулярно обновляйте LM Studio до последней версии
  • Скачивайте модели только из встроенного каталога (прямо через поиск в LM Studio)
  • Для русского языка ищите модели с пометкой «Instruct» или «RU», но Qwen - любые работают с русским языком
  • Закрывайте приложение полностью, когда не используете — модели занимают RAM
⚠️

Возможные Проблемы

  • Модель не загружается: проверьте наличие свободной RAM (закройте другие программы)
  • Медленная генерация: выберите модель меньшего размера или более агрессивное квантование (Q3, Q4)
  • «Бесконечный» вывод: ограничьте Max Tokens в настройках (с тяжёлыми моделями - может играть роль)
  • Плохое качество ответов: попробуйте другую модель или настройте Temperature ниже (0.2-0.3)
  • Не работает на русском: убедитесь, что модель поддерживает русский (ищите в описании на HuggingFace)

Форматы и Квантование

📦

GGUF

Бинарный формат от llama.cpp для локальных LLM.

Хранит веса и метаданные оптимально для быстрого чтения и инференса.

Используют: LM Studio, Ollama, GPT4All, llama.cpp

🍎

MLX

Новый формат Apple Metal для M1–M4 устройств.

Поддерживает 4‑битное квантование моделей.

Пакеты: .mlx (text-only), mlx-vlm (vision+text)

📉

Квантование

Сжатие модели по точности (8‑, 4‑бит), что уменьшает размер и требования к ОЗУ.

Пример: Qwen3-8B в FP16 ≈ 16-18 GB, в 4-бит ≈ 5-8 GB

🎯 Ещё пара слов о квантовании

Квантование — это процесс сжатия нейросетевой модели за счёт снижения разрядности её весов (например, с 16 бит до 4 или 8 бит), что значительно уменьшает размер файла и требования к оперативной памяти. Например, модель Qwen3-8B в формате FP16 занимает ~16–18 GB памяти, а после 4-битного квантования — всего ~5–8 GB. Это позволяет запускать большие модели на устройствах с ограниченными ресурсами (например, на MacBook с 16–32 GB RAM). Потеря качества при этом минимальна — модель сохраняет большую часть своих способностей, хотя может работать немного медленнее. Популярные форматы квантования включают Q4_K_M, Q5_K_M, Q8_0 и используются в GGUF и MLX..

Формат Описание Квантование Применение
GGUF Бинарный формат llama.cpp Q4/Q8 и т.д. LM Studio, Ollama, llama.cpp
MLX Apple Metal для M-серии Q4_0, Q4_1, Q8_0 macOS (M1–M4)
Quantize Снижение разрядности весов Снижает ОЗУ в ~3-4× Локальный запуск

Для MacBook M4 Max (128 GB)

💻 Рекомендуемые модели

На современных Mac M4 Max (128 GB unified RAM) можно запускать большие модели локально. Особенно подходят модели с открытыми весами, оптимизированные под квантование.

☁️

Qwen3

8B версия: FP16 ≈ 16-18 GB, 4-bit ≈ 5-8 GB

30B-A3B: ≈ 32 GB RAM + 8 GB видеопамяти

Контекст: 256K токенов

Производительность: ~72-102 токена/с

Форматы: GGUF, MLX

Qwen3.5

Малые: 9B, 4B, 2B – 10-20 GB памяти

Большие: 35B-A3B, 27B – ≈ 40 GB

Контекст: 256K–1M токенов

Форматы: GGUF, MLX

Репозиторий: HuggingFace

🔓

GPT-OSS

gpt-oss-20b: 21B параметров, 3.6B активных

gpt-oss-120b: 117B, 5.1B активных

Контекст: 131K токенов

Требования: всего 16 GB памяти

Форматы: SafeTensors, GGUF

⚙️

Рекомендации по настройке

  • Оптимальный выбор 4-битное квантование (Q4_K_M для Qwen3)
  • Запускайте через LM Studio или Ollama
  • В Ollama задайте длину контекста (num_ctx) и токенов (num_predict)
  • Регулярно обновляйте llama.cpp и движки
  • Скачивайте веса с HuggingFace или GitHub QwenLM

Безопасность и Приватность

Рекомендации

  • Загрузка из надёжных источников: используйте только официальные репозитории (HuggingFace, GitHub)
  • Оффлайн-запуск: локальные модели не имеют доступа в Интернет
  • Обновляйте ПО: используйте актуальные версии LM Studio, Ollama
  • Проверка целостности: сверяйте контрольные суммы (SHA256)
  • Ограничения доступа: не передавайте конфиденциальную информацию
  • Шифрование и изоляция: храните модели на зашифрованном диске
⚠️

Важно помнить

Формат GGUF теоретически может скрывать вредоносный код, поэтому лучше брать модели, проверенные сообществом (HuggingFace сканирует свои файлы).

Локальные LLM по сути «печатающая машинка», но уязвимости могут возникнуть в среде выполнения, особенно при работе с файлами моделей.

Запускать локальный LLM в изолированном окружении (виртуальная машина, sandbox) – дополнительная гарантия.

📋 Рабочий процесс

1. Выбор менеджера
2. Выбор модели
3. Запуск