Расход на API растёт не из-за «дорогого Heli», а из-за модели, длины промптов и частоты запросов. Ниже — проверенные способы снизить счёт без потери качества на ключевых задачах.
Выберите модель под задачу
Не используйте GPT-4.1 или Claude Sonnet для классификации «да/нет». Для рутины — GPT-4.1 mini, DeepSeek V4 Flash или Gemini Flash.
Сократите prompt и историю
- Уберите дубли в system prompt.
- Обрезайте history до N последних сообщений.
- В RAG передавайте только релевантные chunks, не весь документ.
Кэшируйте и батчите
Повторяющиеся ответы (FAQ, статичные инструкции) сохраняйте на backend. Не вызывайте LLM на каждый одинаковый запрос.
Считайте до продакшена
Перед запуском прогоните типичный запрос через калькулятор и умножьте на дневной объём.
Попробуйте Heli за 30 секунд
Ключ sk-heli- и кабинет создаются сразу. После подтверждения почты — 50 ₽ на баланс.