В RAG-пайплайне стоимость складывается из двух частей: эмбеддинги для поиска по базе и генерация ответа по найденным фрагментам. Heli даёт доступ к chat-моделям через getheli.ru/v1 с оплатой в рублях; для эмбеддингов используйте отдельный endpoint embeddings с подходящей моделью из каталога OpenRouter.
Эмбеддинги
На этапе индексации и поиска нужна модель embeddings — она превращает текст в вектор для similarity search. Слаги и цены смотрите в каталоге моделей (фильтр по провайдеру OpenAI, Voyage, Cohere и др.). Эмбеддинги обычно дешевле chat-моделей и вызываются один раз при индексации плюс один раз на каждый пользовательский запрос.
Пример: openai/text-embedding-3-small для большинства корпоративных баз. Подробности формата — в документации Heli.
Генерация ответа — выбирайте дешевле
После retrieval в промпт попадает контекст из документов — это увеличивает число входных токенов. Поэтому для финального ответа разумно брать недорогие модели:
- Gemini 2.5 Flash — низкая цена входа, выгодно при длинном контексте.
- GPT-4.1 mini — предсказуемый стиль и JSON, если нужен structured output.
- DeepSeek V4 Flash — минимальный бюджет на больших объёмах.
Когда нужна сильная модель
Если в контексте противоречивые документы, нужен сложный синтез или юридически значимый текст — подключите GPT-4.1 или Claude Sonnet 4 только на этапе генерации, оставив дешёвые эмбеддинги без изменений.
Советы по экономии
- Обрезайте чанки: не тащите в prompt весь документ, только top-k релевантных фрагментов.
- Переиспользуйте эмбеддинги документов — не пересчитывайте при каждом деплое.
- Сжимайте metadata в промпте: заголовок + абзац, а не десять страниц.
Для чат-ботов без RAG — см. выбор модели для чат-бота; сравнение Flash и mini — Gemini vs GPT-4 mini.
Попробуйте Heli за 30 секунд
Ключ sk-heli- и кабинет создаются сразу. После подтверждения почты — 50 ₽ на баланс.