Как выбрать модель
Страница помогает сориентироваться под задачу. Полный перечень маршрутов и точные коэффициенты — в разделе Доступные модели (Nexuses), методика расчёта — в разделе Расчёт A-токенов.
Логика выбора
Идти проще сверху вниз:
- Определите тип задачи. Текст, изображение, видео, звук, векторный поиск — у каждого типа свой API-путь и свой набор маршрутов.
- Выберите уровень. Для текстовых задач разница между моделями — это в первую очередь баланс качества и стоимости.
- Проверьте требования к персональным данным. Если в запросах есть ПДн, посмотрите protected-маршруты.
- Сверьтесь с лицензией. Доступный именно вам список всегда возвращает
GET /v1/models.
Три уровня текстовых моделей
Каталог удобно мысленно делить на три уровня. Это не тарифные группы, а способ быстро сузить выбор: модели внутри уровня решают схожий класс задач при сопоставимой стоимости.
Лёгкий уровень
Короткие ответы при большом потоке запросов. Классификация обращений, извлечение полей из формы, определение языка или тональности, автодополнение, предварительная фильтрация перед более дорогой моделью.
Здесь важнее пропускная способность и задержка, чем глубина рассуждения. Примеры маршрутов этого уровня — opr.claude-haiku-4.5.chat_completions, opr.gemini-3.5-flash-lite.chat_completions, opr.llama-3.1.chat_completions.
Средний уровень
Основной рабочий поток. Суммаризация документов, деловая переписка, ответы ассистента по базе знаний, генерация описаний, разбор обращений с формированием ответа.
Именно здесь стоит держать большую часть нагрузки. Примеры — opr.qwen-3.7-max.chat_completions, opr.gemini-3.6-flash.chat_completions, opr.deepseek4_pro.chat_completions.
Продвинутый уровень
Задачи, где цена ошибки выше цены запроса: юридический и финансовый анализ, многошаговые агентные сценарии, работа со сложным контекстом, код-ревью крупных изменений.
Примеры — opr.claude-opus-5.chat_completions, opr.claude-sonnet5.chat_completions, opr.gpt-5.5.chat_completions.
Границы между уровнями подвижны: модель, уместная для суммаризации, может оказаться избыточной для классификации и недостаточной для юридического разбора. Ориентируйтесь на задачу, а не на название модели.
Что выбрать под задачу
| Задача | Куда смотреть |
|---|---|
| Классификация, разметка, извлечение полей | Лёгкий уровень |
| Суммаризация и работа с документами | Средний уровень |
| Ассистент по базе знаний (RAG) | Средний уровень + embeddings и reranker |
| Юридический или финансовый анализ | Продвинутый уровень |
| Агентные сценарии с вызовом инструментов | Продвинутый уровень |
| Написание и разбор кода | Модели с кодовой специализацией |
| Ответы с опорой на актуальные данные из интернета | Модели с встроенным веб-поиском |
| Обработка текста с персональными данными | Protected-маршруты |
| Распознавание документов | Маршруты OCR |
| Речь в текст и текст в речь | Маршруты транскрипции и синтеза |
| Генерация изображений | Маршруты с суффиксом .images или .chat_completions |
| Генерация видео | Маршруты с суффиксом .videos |
Специализированные сценарии
Программирование
Отдельная группа моделей обучена на коде и заметно лучше держит контекст репозитория, диффы и стек-трейсы. Для генерации и ревью кода берите их, а не универсальную модель того же уровня.
Поиск в интернете
Часть моделей отвечает с опорой на актуальные веб-данные — это снимает проблему устаревших знаний, но такие маршруты дороже: плата за поиск уже включена в коэффициент выхода. Используйте их точечно, там, где нужна свежесть, а не как модель по умолчанию.
RAG: векторизация и переранжирование
Строится из двух частей: embeddings превращают текст в векторы для поиска, reranker переупорядочивает найденные фрагменты по релевантности. У embeddings-маршрутов тарифицируются только входящие токены.
Доступны и локальные, и внешние варианты — выбор влияет на то, покидает ли текст контур провайдера.
Работа со звуком
Транскрипция аудио в текст, разделение по говорящим и синтез речи. Транскрипция и диаризация выполняются на локальной инфраструктуре.
Генерация изображений
Два протокола, и это первое, что нужно определить. Маршруты с суффиксом .chat_completions вызываются как обычный чат — изображение приходит в ответе. Маршруты с суффиксом .images используют отдельный путь /images и поле prompt вместо messages. Разбор обоих — в разделе Примеры подключения и использования.
Генерация видео
Асинхронный протокол из трёх шагов: постановка задания, опрос статуса, скачивание результата. У каждого шага свой маршрут. Списание фиксированное за генерацию, параметры ролика задаёт платформа.
Локальные и внешние модели
Помимо задачи и уровня выбор определяет ещё один параметр — где физически выполняется запрос.
Локальные модели размещены на инфраструктуре ITGLOBAL.COM: текстовые itg.qwen_3.6.chat_completions, itg.qwen_next.chat_completions, itg.gemma-4-26b-a4b.chat_completions, а также все AI-инструменты — OCR, транскрипция, синтез речи, PII, embeddings, reranker, конвертация документов. Запрос не покидает контур провайдера.
Внешние модели обращаются к API сторонних провайдеров. Среди них есть и российские — sbr.gigachat-* и yndx.*. Контур можно собрать только на локальных и российских моделях, не выпуская запросы к зарубежным провайдерам.
Потребление по этим двум группам учитывается раздельно: остаток Local-пакета нельзя израсходовать на External-модели.
Практические ориентиры
Начинайте со среднего уровня. Подняться на уровень выше из-за нехватки качества проще, чем объяснять перерасход после запуска на самой дорогой модели.
Разделяйте поток. Классификацию и извлечение полей отдавайте лёгким моделям, финальный ответ пользователю — среднему или продвинутому уровню. На объёмных сценариях это экономит больше, чем попытка подобрать одну модель подешевле на весь поток.
Считайте вход, а не только выход. В потребление попадают системный промпт, история диалога, RAG-контекст и содержимое документов. Коэффициент выхода обычно в несколько раз выше входного, но по объёму вход чаще доминирует.
Проверяйте доступность до интеграции. Наличие маршрута в каталоге не означает, что он открыт вашему ключу. Сверяйтесь с GET /v1/models.
Фиксируйте маршрут в конфигурации, а не в коде. Модели обновляются, и смена маршрута не должна требовать пересборки приложения.