Хотите заказать веб-сайт? Связаться с нами

Выбор плана и модели для ИИ-агента

Модель, которую вы подключаете к ИИ-агенту, определяет качество результата, скорость работы и размер счёта в конце месяца. В этом уроке разберём, из чего складываются планы и тарифы, чем отличаются классы моделей и как выбрать конфигурацию под конкретную задачу.

Главная идея: выбор модели — это не вкусовщина, а инженерное решение с измеримыми параметрами.

Выбор плана и модели для ИИ-агента

Почему выбор модели — инженерное решение

Новичок обычно спрашивает «какая модель лучше» и ждёт один ответ навсегда. На практике ответ всегда один: «зависит от задачи». У любой модели есть три ограниченных ресурса, и выбор сводится к балансу между ними:

  1. Деньги — стоимость входных и выходных токенов или цена подписки.
  2. Время — скорость генерации ответа и время ожидания пользователя.
  3. Качество — способность рассуждать, удерживать контекст и выдавать корректный код.

Улучшение одного параметра почти всегда ухудшает другой.

Самая «умная» модель отвечает медленно и стоит дорого, самая дешёвая — быстро, но на сложной задаче может ошибиться. Задача инженера — найти точку баланса, а не гнаться за максимумом по одному критерию.

Три параметра выбора

Качество рассуждений

Это способность модели решать многошаговые задачи: планировать, анализировать ошибки, переписывать архитектуру. На простых задачах разница между моделями невелика, но на сложных она становится решающей.

Скорость

Быстрый ответ важен в интерактивной работе: пока агент «думает», вы ждёте. Для мелких правок задержка в несколько секунд терпима, для долгих сеансов рефакторинга — уже нет.

Стоимость

Складывается из цены за входные и выходные токены. Дорогая модель при активной работе может стоить в десятки раз больше дешёвой, поэтому важно считать не цену за запрос, а цену за результат.

Классы моделей

Модели с длинным рассуждением

Такие модели перед ответом «думают»: строят внутренние рассуждения, проверяют гипотезы, перепроверяют себя. Их стихия — сложные задачи: проектирование, отладка, миграции, ревью. Минусы — медленнее и дороже.

Быстрые универсальные модели

Отвечают почти мгновенно и хорошо справляются с типовыми задачами: объяснить код, написать тест, поправить баг. Оптимальны для повседневной работы, когда задержка важнее глубины рассуждений.

Компактные модели

Малые модели с минимальной ценой. Подходят для однозначных задач: переписать функцию, отформатировать код, извлечь данные. На сложных задачах требуют контроля и частых проверок результата.

Класс модели Когда выбирать
С длинным рассуждением Архитектура, отладка, ревью, миграции
Быстрая универсальная Повседневная разработка, типовые правки
Компактная Однозначные задачи, массовая обработка

Из чего складывается тариф

Поставщики обычно предлагают два способа оплаты, и важно понимать разницу заранее.

Подписка с фиксированной ценой

Вы платите фиксированную сумму в месяц и получаете лимит запросов. Подходит, если работаете с агентом ежедневно. Смотрите не только цену, но и лимиты: сколько запросов в час и в день, какой максимум context window, есть ли приоритетный доступ в часы пик.

Оплата за использование

Цена за токены — прозрачная схема для редкой работы, но расход легко недооценить. Базовая формула простая:

Стоимость = (входные токены × цена входа) + (выходные токены × цена выхода)

Пример прикидки бюджета на один сеанс работы с агентом:

Вход:  150 000 токенов × $2 за 1 млн = $0,30
Выход:  30 000 токенов × $8 за 1 млн = $0,24
Итого за сеанс: ≈ $0,54

Обратите внимание: входные токены обычно дешевле выходных, но их в разы больше — агент постоянно пересылает историю диалога. Подробнее о расходе контекста — в уроках про сессии и контекст.

Начинайте с быстрой дешёвой модели, а «умную» подключайте только когда упрётесь в качество. Большинство задач не требуют максимального reasoning — так вы сэкономите и деньги, и время ожидания.

Лимиты и rate limits

Даже по подписке есть ограничения: максимум запросов в минуту, максимум токенов на запрос, максимум сообщений в сеанс. Превышение лимита приводит к паузам или ошибкам, поэтому при выборе плана сравнивайте не только цену, но и лимиты.

Как прикинуть стоимость проекта

Лучший способ — не гадать, а снять замеры на небольшой выборке. Возьмите три-пять типовых задач и прогоните их на кандидатах. Считайте не цену одного запроса, а полную стоимость сеанса: вход плюс выход плюс повторные попытки после ошибок.

  1. Зафиксируйте среднее число токенов на типовую задачу.
  2. Умножьте на число задач в день.
  3. Сравните итог с ценой подписки.
  4. Добавьте запас на неудачные попытки и повторы.

Если суммарный расход приближается к цене подписки или превышает её — подписка выгоднее. Если работаете редко — оплата за использование дешевле.

Матрица выбора под задачу

Сведите решение к простому правилу: сложность задачи определяет класс модели.

Задача Рекомендуемый класс
Новая фича с нуля С длинным рассуждением
Починка бага Быстрая универсальная
Форматирование кода Компактная
Миграция базы данных С длинным рассуждением
Объяснение фрагмента кода Быстрая универсальная
Массовая генерация шаблонов Компактная

Стратегия нескольких моделей

Опытные команды не выбирают одну модель — они строят маршрутизацию: сложный этап работы отдаётся сильной модели, рутина — быстрой.

Многие harness поддерживают переключение модели внутри сессии и запуск субагентов на других моделях. Подробнее — в уроке про субагентов, а пока запомните базовую схему:

  1. Планирование и проектирование — сильная модель.
  2. Реализация и мелкие правки — быстрая модель.
  3. Массовые однотипные операции — компактная модель.
  4. Финальная проверка и ревью — сильная модель.

Типичные ошибки

  1. Выбор «самой умной» модели для всех задач — переплата и медленная работа.
  2. Экономия на всём подряд — низкое качество на ключевых этапах.
  3. Оценка бюджета по цене одного запроса, а не сеанса.
  4. Игнорирование лимитов тарифа — неожиданные паузы в работе.
  5. Смена моделей без замеров — невозможно понять, что улучшилось.

Ведите «журнал замеров»: один файл, куда записываете задачу, модель, время выполнения, стоимость и оценку результата. Через неделю у вас будет персональная таблица, по которой видно, какая модель реально выгодна под ваши задачи.

Итоги

Выбор плана и модели — это баланс между стоимостью, скоростью и качеством рассуждений под конкретный тип задач. Начинайте с быстрой модели, подключайте сильную по необходимости, а решения принимайте на основе замеров, а не рекламы.

В следующем уроке настроим учебный проект: инициализируем репозиторий, установим зависимости и запустим первое упражнение.

Глоссарий

  1. LLM — большая языковая модель, генерирующая ответы на запросы.
  2. Тариф (план) — условия оплаты и лимиты использования модели.
  3. Подписка — фиксированная ежемесячная оплата с лимитами.
  4. Pay-as-you-go — оплата за фактическое использование токенов.
  5. Токен — единица текста, которой измеряется вход и выход.
  6. Входные токены — токены запроса и истории диалога.
  7. Выходные токены — токены ответа модели.
  8. Reasoning — «рассуждение» модели перед выдачей ответа.
  9. Context window — объём текста, который модель «помнит» в сессии.
  10. Rate limit — ограничение числа запросов в единицу времени.
  11. Harness — оболочка, через которую вы работаете с моделью.
  12. Субагент — отдельный агент с независимым контекстом.
  13. Маршрутизация — распределение задач между разными моделями.

Теги: