Docs

Rate limits

Los rate limits van por API key — RPM y concurrencia — no por tokens totales.

Límites por key

LímiteValor
Peticiones por minuto100 rpm
Concurrencia5 peticiones simultáneas
Tokens por minuto2M tpm (modelos de lenguaje)

Los modelos de embeddings y voz tienen sus propios límites de petición. Consulta Modelos.

Búsqueda web

La herramienta de búsqueda web (/v1/search) tiene sus propios límites, independientes de tu presupuesto de tokens de chat:

LímiteValor
Peticiones por minuto60 rpm
Búsquedas por día3.000 / día
Concurrencia10 peticiones simultáneas

Si superas cualquiera de ellos, el endpoint devuelve 429 con una cabecera Retry-After. Las consultas idénticas repetidas en ~15 minutos se sirven desde caché y no llegan a un proveedor externo, pero siguen contando contra tu límite de peticiones y tu cuota diaria. Consulta la Referencia API para el formato completo de petición y respuesta.

Volumen mensual

Los modelos open eficientes son ilimitados en todos los planes — los modelos más grandes, de clase frontier, cuentan contra una cuota mensual que escala con tu plan:

PlanCuota mensual
Starter2,5B tokens
Growth7,5B tokens
Scale20B tokens
EnterprisePersonalizada

Si superas tu cuota, te avisamos antes de cobrarte el exceso. Consulta Precios para el desglose completo.

Gestionar el 429

Cuando superas un límite, la API devuelve 429 Too Many Requests. Haz backoff y reintenta. La mayoría de SDK de OpenAI ya lo hacen por ti con backoff exponencial — la cabecera Retry-After te dice cuánto esperar.

# el SDK de OpenAI reintenta los 429 automáticamente — ajusta el número si hace falta
client = OpenAI(
    base_url="https://api.helmcode.com/v1",
    api_key="sk-your-key-here",
    max_retries=5,
)

¿Necesitas límites más altos?

Las cargas de alta demanda pueden obtener más RPM y concurrencia unificada bajo petición. Los planes Dedicated y Enterprise además corren sobre hardware reservado para ti, con rendimiento garantizado. Habla con nosotros.