sectores · Herramientas para desarrolladores

Modelos de código abiertos a tarifa plana. Tu margen deja de depender del pricing de un tercero.

La inferencia es el COGS de un producto de coding: cada punto de margen bruto depende del precio por token. Modelos de código abiertos a tarifa plana convierten esa variable en una línea fija.

la economía

La economía, por diseño.

Cada palanca de coste, mapeada a una capacidad de la plataforma. La soberanía viene de serie.

Margin

inferencia = tu COGS

El problemaCada punto de margen bruto depende del precio por token de un tercero.

HelmcodeTarifa plana por API key: el coste deja de escalar con el uso y el margen deja de depender del pricing ajeno.

Frontier code

GLM-5.2 · DeepSeek V4 Pro

El problemaNecesitas código a nivel frontier sin la factura de una API frontier.

HelmcodeGLM-5.2 lidera el coding agéntico (62.1% SWE-bench Pro); DeepSeek V4 Pro la generación acotada (80.6% Verified). Ambos abiertos y self-hosteables.

Sovereignty

UE · on-premise

El problemaEl código de tus clientes no debería viajar a una API externa.

HelmcodePesos abiertos en infraestructura UE u on-premise: el código no sale de tu perímetro.

cómo se mide la capacidad de programar

Qué le pide realmente SWE-bench a un modelo.

Todo proveedor te cita una puntuación de código. Conviene saber qué hace el benchmark que está detrás, porque es más duro que un conjunto de acertijos y porque las cifras se mueven lo bastante rápido como para que cualquier número sin fecha no valga nada.

01

Issues reales, repositorios reales

El benchmark se construye con 2.294 problemas de ingeniería de software tomados de issues reales de GitHub y sus pull requests correspondientes, en 12 repositorios populares de Python. El modelo recibe un código base y la descripción de un issue, y tiene que editar el código.

02

Cruza archivos, no funciones

Los autores dicen explícitamente que resolver estos issues exige a menudo entender y coordinar cambios en varias funciones, clases e incluso archivos a la vez, interactuar con entornos de ejecución y procesar contextos muy largos. Por eso la ventana de contexto y el precio por token dejan de ser preocupaciones separables.

03

Pide siempre la fecha

Cuando se publicó el benchmark en 2023, el mejor modelo del momento resolvía el 1,96% de los issues. Los sistemas actuales están muy por encima y eso es justo lo importante: una puntuación de código sin fecha y sin versión del sistema no te dice nada, tampoco la nuestra.

SWE-bench · Princeton NLP and collaborators "SWE-bench: Can Language Models Resolve Real-World GitHub Issues?", arXiv:2310.06770. Los leaderboards oficiales de swebench.com separan sistemas de código abierto de propietarios y cubren varias variantes, entre ellas SWE-bench Verified y SWE-bench Multilingual, así que una afirmación se puede comprobar en vez de creer. leer el informe →

casos de uso

Tus casos de uso más habituales.

Los casos con más tracción en el sector, cada uno con su página en detalle.

Modelos abiertos recomendados.

Un punto de partida por tipo de tarea. La guía completa cruza 80 casos con el modelo abierto de cada uno.

GLM-5.2MIT · 1M ctx
El líder abierto en coding agéntico y ejecuciones largas multi-paso sobre repos reales.
DeepSeek V4 ProMIT · 1M ctx · 1.6T/49B act
El rey de la generación acotada: 80.6% SWE-bench Verified, 93.5% LiveCodeBench.
DeepSeek V4 FlashMIT · 1M ctx en Helmcode
El caballo de batalla a tarifa plana para tareas de código acotadas y de alto volumen.

en caminoEstamos destilando y cuantizando estos modelos abiertos en versiones pequeñas y muy especializadas, entrenadas para una tarea concreta en lugar de para todas. Un modelo así corre en menos hardware, responde antes y cabe en sitios donde el grande no entra, incluido tu propio datacenter. Si tienes un proceso con volumen y criterio estable, es la conversación que queremos tener contigo.

// faq

Preguntas, respondidas.

Lo que preguntan los equipos técnicos, de compliance y de negocio del sector.

¿Por qué decide el coste de inferencia nuestro margen?

En un producto de coding, la inferencia es el coste de las ventas: escala directamente con el uso. En una API por token, crecer erosiona el margen bruto. Una tarifa plana por API key fija la línea, así que escalar usuarios ya no escala la factura.

¿Qué nivel tiene el código abierto hoy?

GLM-5.2 lidera el coding agéntico (62.1% SWE-bench Pro, 81 Terminal-Bench) y DeepSeek V4 Pro la generación acotada (80.6% SWE-bench Verified, 93.5% LiveCodeBench, #1 global). La frontera abierta está a pocos puntos de la cerrada.

¿Es drop-in para la API de OpenAI?

Sí. Cambia la base URL y la clave y Cursor, Zed, OpenCode, LangChain o tus clientes propios siguen funcionando sin cambios.

¿Podemos self-hostear?

Sí. Dedicado u on-premise ejecuta los mismos modelos y la misma API dentro de tu infraestructura, así el código de cliente no sale de tu perímetro.

// empezar

EMPIEZA A QUEMAR TOKENS

Olvídate de la infra de IA. Despliega hoy el primer endpoint de inferencia privada.

Tarifa plana. Datos en la UE. Compatible con la API de OpenAI.