Можно ли уложить RAG за ~1000 ₽/мес через Heli? Да — если правильно выбрать модель, сжать контекст и ограничить объём запросов. Ниже — реалистичный расчёт и минимальный стек.
Из чего складывается бюджет
RAG = retrieval (поиск по базе) + generation (ответ модели). Heli списывает только за generation:
- Embeddings — Heli сейчас через chat; для RAG часто хватает локальных embeddings (sentence-transformers) или отдельного сервиса.
- Generation — основная статья расходов. Выбор модели решает всё.
Пример расчёта на 1000 ₽
Допустим, 500 запросов в месяц, ~2000 токенов входа (документ + вопрос) и ~500 токенов выхода на запрос. Итого ~1M вход + 0.25M выход.
| Модель | Ориентир | 500 запросов/мес |
|---|---|---|
| Gemini Flash | Дёшево | Обычно укладывается в 500–1500 ₽ |
| DeepSeek V4 Flash | Очень дёшево | Часто 300–800 ₽ |
| GPT-4.1 mini | Средне | ~800–2000 ₽ |
| Claude Sonnet | Дороже | Может превысить 1000 ₽ |
Точные цифры — на страницах моделей в каталоге Heli; таблица — порядок величин.
Минимальный RAG на Python
from openai import OpenAI
client = OpenAI(base_url="https://getheli.ru/v1", api_key="sk-heli-…")
def answer(question: str, chunks: list[str]) -> str:
context = "\n---\n".join(chunks[:5]) # top-5, не весь корпус
response = client.chat.completions.create(
model="google/gemini-2.5-flash",
messages=[
{"role": "system", "content": "Отвечай только по контексту. Кратко."},
{"role": "user", "content": f"Контекст:\n{context}\n\nВопрос: {question}"},
],
max_tokens=400,
)
return response.choices[0].message.content or ""Как уложиться в 1000 ₽
- Модель: Gemini Flash или DeepSeek V4 Flash.
- Top-k = 3–5 чанков, не 20.
- max_tokens = 300–500 на ответ.
- Кэшируйте частые вопросы на своей стороне.
- Суммаризируйте длинные документы offline, в prompt — только выжимка.
Выбор модели под RAG — в «Какую модель выбрать для RAG». Сравнение Gemini vs GPT-4 mini — здесь.
Попробуйте Heli за 30 секунд
Ключ sk-heli- и кабинет создаются сразу. После подтверждения почты — 50 ₽ на баланс.