Перейти к содержанию

Модели

Koda CLI работает с моделями Koda и поддерживает подключение собственных OpenAI-совместимых моделей. Модель выбирается командой /model, флагом --model или настройкой model. Для сложных задач качество ответа регулируется уровнем размышлений (reasoning effort).

Выбор модели

По умолчанию используется модель koda-base.

Модель для сессии задаётся одним из способов:

  • команда /model внутри сессии — открывает диалог выбора;
  • флаг --model (или -m) при запуске CLI;
  • настройка model в settings.json;
  • переменная окружения KODA_MODEL.

koda-base KODA_MODEL

Приоритет от высшего к низшему: CLI-флаг → переменная окружения → settings.json → значение по умолчанию. Команда /model и флаг --model применяются к текущей сессии и сохраняются в настройках выбранной области (пользовательские, рабочие или системные).

Доступные модели

Список моделей, которые видны в диалоге /model, зависит от аккаунта и тарифа. Стоимость и лимиты моделей описаны в разделе Тарифы, модели и лимиты.

Команда /model

Введите /model в сессии — появится список доступных моделей. Переключайте область изменения клавишей Tab, выбор — Enter. Полное описание команды — в справочнике команд.

Флаг --model

Модель можно задать при запуске:

koda --model koda-base
koda -m koda-base -p "Объясни структуру проекта"

Подробнее о флаге — в справочнике аргументов.

Настройка model

Модель по умолчанию задаётся в settings.json:

~/.kodacli/settings.json
{
  "model": "koda-base"
}

Описание ключа — в настройках.

Сторонние модели

Koda CLI позволяет подключить OpenAI-совместимую модель: указывается идентификатор модели, базовый URL провайдера и API-ключ. Сохранённые модели появляются в списке /model и помечаются как (custom).

Сторонние модели недоступны для SaaS-пользователей.

Как добавить, отредактировать или удалить кастомную модель — описано в справочнике команд.

Размышления модели

Некоторые модели обдумывают запрос перед ответом. Чем глубже размышления, тем больше времени и токенов модель тратит на анализ и тем выше качество ответа на сложных задачах. Низкие уровни отвечают быстрее и экономнее.

Команда /reasoning

Команда /reasoning (алиас /effort) устанавливает уровень размышлений для текущей модели:

/reasoning        открыть диалог выбора уровня
/reasoning high   установить уровень high
/effort low       то же через алиас

Выбор сохраняется для конкретной модели и применяется только если модель поддерживает этот уровень. Если модель не поддерживает размышления, команда сообщит об этом.

Уровни размышлений

Уровень Что означает
none Модель отвечает сразу, без обдумывания
minimal Короткое обдумывание перед ответом
low Беглый разбор простых задач
medium Баланс скорости и глубины
high Подробный разбор, ответ идёт дольше
xhigh Самый глубокий разбор для сложных задач

Каждая модель поддерживает свой набор уровней — в диалоге и автодополнении видны только доступные для выбранной модели. Если уровень не задан, используется уровень по умолчанию, который объявляет сервер.

Настройка reasoningEffortByModel

Уровень можно задать для нескольких моделей сразу в settings.json:

~/.kodacli/settings.json
{
  "reasoningEffortByModel": {
    "koda-base": "high",
    "koda-pro": "xhigh"
  }
}

Описание ключа — в настройках.

Отображение размышлений

Сколько текста размышлений показывать во время ответа, регулируется отдельно от уровня. Режим меняется командой /reasoning display <режим> или отдельной командой /reasoning-display:

/reasoning display compact
/reasoning-display full
Режим Поведение
off Размышления не показываются и не сохраняются в истории
compact Заголовок фазы рядом со спиннером и короткая пометка в истории (по умолчанию)
stream Скользящее окно с текстом размышлений
full Как stream, но полный текст размышлений остаётся в истории

Описание настройки reasoningDisplay — в настройках.

Настройки генерации

В отличие от некоторых CLI, Koda CLI не предоставляет прямого управления гиперпараметрами генерации (temperature, topP, maxOutputTokens). Параметры запроса определяются моделью и сервером Koda.

Качество и стиль ответа регулируются двумя средствами:

  • выбор модели — разные модели дают разный баланс скорости и глубины;
  • уровень размышлений — команда /reasoning или настройка reasoningEffortByModel.

Этого достаточно для большинства сценариев: простые задачи решаются быстрее на низком уровне, сложные — глубже на высоком.

Рекомендации

  • Простые задачи — конвертация форматов, короткие объяснения, генерация шаблонного кода. Используйте низкий уровень размышлений (low или minimal), чтобы получить ответ быстрее и экономнее.
  • Сложные задачи — многошаговая отладка, проектирование архитектуры, рефакторинг с риском регрессий. Повысьте уровень до high или xhigh, чтобы модель подробнее обдумала решение.
  • Переключение на лету — и модель, и уровень размышлений можно менять в любой момент сессии командами /model и /reasoning. Изменения применяются к следующему запросу.
  • Баланс по умолчанию — если не задавать уровень вручную, модель использует уровень по умолчанию, рекомендованный сервером. Это разумный старт для большинства задач.