Heli

← Блог

Кейс: RAG за 1000 ₽/мес через Heli

Можно ли уложить RAG за ~1000 ₽/мес через Heli? Да — если правильно выбрать модель, сжать контекст и ограничить объём запросов. Ниже — реалистичный расчёт и минимальный стек.

Из чего складывается бюджет

RAG = retrieval (поиск по базе) + generation (ответ модели). Heli списывает только за generation:

  • Embeddings — Heli сейчас через chat; для RAG часто хватает локальных embeddings (sentence-transformers) или отдельного сервиса.
  • Generation — основная статья расходов. Выбор модели решает всё.

Пример расчёта на 1000 ₽

Допустим, 500 запросов в месяц, ~2000 токенов входа (документ + вопрос) и ~500 токенов выхода на запрос. Итого ~1M вход + 0.25M выход.

МодельОриентир500 запросов/мес
Gemini FlashДёшевоОбычно укладывается в 500–1500 ₽
DeepSeek V4 FlashОчень дёшевоЧасто 300–800 ₽
GPT-4.1 miniСредне~800–2000 ₽
Claude SonnetДорожеМожет превысить 1000 ₽

Точные цифры — на страницах моделей в каталоге Heli; таблица — порядок величин.

Минимальный RAG на Python

from openai import OpenAI

client = OpenAI(base_url="https://getheli.ru/v1", api_key="sk-heli-…")

def answer(question: str, chunks: list[str]) -> str:
    context = "\n---\n".join(chunks[:5])  # top-5, не весь корпус
    response = client.chat.completions.create(
        model="google/gemini-2.5-flash",
        messages=[
            {"role": "system", "content": "Отвечай только по контексту. Кратко."},
            {"role": "user", "content": f"Контекст:\n{context}\n\nВопрос: {question}"},
        ],
        max_tokens=400,
    )
    return response.choices[0].message.content or ""

Как уложиться в 1000 ₽

  • Модель: Gemini Flash или DeepSeek V4 Flash.
  • Top-k = 3–5 чанков, не 20.
  • max_tokens = 300–500 на ответ.
  • Кэшируйте частые вопросы на своей стороне.
  • Суммаризируйте длинные документы offline, в prompt — только выжимка.

Выбор модели под RAG — в «Какую модель выбрать для RAG». Сравнение Gemini vs GPT-4 mini — здесь.

Попробуйте Heli за 30 секунд

Ключ sk-heli- и кабинет создаются сразу. После подтверждения почты — 50 ₽ на баланс.

Документация API · Модели и цены

Частые вопросы

Реально ли RAG за 1000 ₽/мес?
Да при ~500 запросах и модели Gemini Flash или DeepSeek V4 Flash: сжимайте контекст, top-k 3–5 чанков, max_tokens 300–500.
Какая модель дешевле для RAG?
DeepSeek V4 Flash и Gemini 2.5 Flash — см. цены на /models/deepseek и /models/gemini.

Читайте также