Qué GPU necesitas para servir modelos de IA

Qué GPU necesitas para servir modelos de IA

FP8, NVFP4, H200, B200: qué acelera en hardware cada generación de NVIDIA, cuánta VRAM necesita tu modelo y qué GPU comprar. Con datos de producción reales.

Elegir GPUs para inferencia no va de comprar la más cara. Va de comprar la que entiende el formato en el que vive tu modelo.

Cada generación añade soporte hardware para formatos de números más pequeños (FP8, NVFP4, FP6), y cada formato nuevo se traduce en una de tres cosas: modelos más grandes en la misma VRAM, más throughput, o menos GPUs para servir la misma carga. Pero no todas las GPUs soportan todos los formatos. Si tu modelo usa un formato que la GPU no acelera en silicio, pagas la penalización de la ruta emulada en software, que suele ser entre 2x y 10x más lenta.

Aquí van las familias que importan hoy, julio de 2026, qué acelera cada una, y cómo traducir eso a una decisión de compra concreta: desde un MoE compacto como Qwen3.6-35B-A3B hasta uno masivo como GLM-5.2.

1. El mapa de arquitecturas de NVIDIA

NVIDIA ha lanzado seis arquitecturas de datacenter en seis años. Cada una introduce Tensor Cores de nueva generación que entienden formatos de precisión más pequeños.

Línea temporal de arquitecturas NVIDIA para IA, de Ampere a Rubin, con los formatos de precisión que acelera cada una

Un detalle que la gente confunde constantemente: la RTX PRO 6000 es Blackwell, no Ada. Comparte los Tensor Cores de 5ª generación de la B200 (NVFP4, FP6 y FP8 en hardware) con 96 GB de GDDR7. No la confundas con la vieja RTX 6000 Ada Generation, que tiene 48 GB y no acelera FP4. Esa diferencia es exactamente por lo que corremos NVFP4 en producción, como contamos en el post de la migración a NVFP4 .

2. Formatos de precisión: qué acelera cada GPU en hardware

No todos los formatos se ejecutan igual en todas las GPUs. Que un modelo esté cuantizado a NVFP4 no significa que corra a máxima velocidad en una H200, porque Hopper no tiene Tensor Cores de 4 bits: los emula sobre FP8 o FP16 y pierdes toda la ventaja de throughput y de memoria.

Una aclaración importante, porque es un error habitual: INT8 es nativo en los Tensor Cores desde Ampere (A100). No se emula. Lo que cambió con las últimas generaciones no es INT8, es el 4 bits. INT4 tuvo su pico en Ampere, Hopper lo dejó de lado, y Blackwell lo sustituyó por NVFP4, que a igual tamaño conserva mucha más precisión numérica gracias al escalado por bloques.

Matriz de compatibilidad entre GPUs NVIDIA y formatos de precisión: FP16, FP8, FP6, NVFP4, INT8 e INT4

Tres cosas que se deducen de esa tabla:

Hopper (H100/H200) es la reina del FP8. Si tu modelo está en FP8, y hoy la mayoría de modelos abiertos publican checkpoint FP8 oficial, Hopper lo sirve a máxima velocidad con su Transformer Engine. Lo que Hopper no entiende es el punto flotante de 4 bits.

Blackwell desbloquea FP4 y FP6 en hardware. NVFP4 no es una cuantización más: son Tensor Cores de 5ª generación que operan nativamente en 4 bits. Nuestro checkpoint NVFP4 de Qwen3.6-35B-A3B ocupa la mitad de VRAM que el FP8 y rinde un 11% más de throughput en la misma tarjeta, con 12 puntos menos de ocupación de KV cache.

Cargar NVFP4 en Hopper funciona, pero no sirve de nada. La GPU lo ejecuta con kernels de software sobre FP8 o FP16. El modelo responde, la ventaja desaparece. Es el error de compra más caro de esta lista, porque no falla: simplemente rinde como si no hubieras hecho nada.

3. Cuánta VRAM necesita tu modelo

Este es el ejercicio que toda empresa debería hacer antes de comprar. Cogemos los tres modelos que servimos en producción y miramos qué GPU los aguanta.

ModeloParámetrosFP16FP8NVFP4
Qwen3.6-35B-A3B (MoE)35B total / 3B activos70 GB ✅35 GB ✅18 GB ✅
DeepSeek-V4-flash (MoE)284B total / 13B activos568 GB284 GB142 GB ✅
GLM-5.2 (MoE)753B total / 40B activos1,5 TB753 GB377 GB

✅ = cabe en una sola GPU actual con margen para KV cache y serving.

La regla de bolsillo: FP16 son ~2 bytes por parámetro, FP8 ~1 byte, NVFP4 ~0,5 bytes. Multiplica por el número de parámetros y ya tienes el peso del modelo. Después súmale el KV cache, que crece con el contexto y con el batch, más el overhead del motor de serving.

VRAM necesaria por modelo y precisión: Qwen3.6, DeepSeek-V4-flash y GLM-5.2 en FP16, FP8 y NVFP4

Qué significa cada fila en decisiones de compra:

Qwen3.6-35B-A3B es diminuto en VRAM. En NVFP4 ocupa unos 18 GB. Cabe en cualquier GPU actual, incluida una RTX PRO 6000 de 96 GB, con muchísimo margen para KV cache y concurrencia. Es justo el modelo que servimos en esa tarjeta.

DeepSeek-V4-flash cambia de categoría según el formato. 284B totales, 13B activos. En NVFP4 son unos 142 GB y entra en una sola B200 (192 GB) o B300 (288 GB) con holgura. En FP8 son 284 GB y ya necesitas dos tarjetas si quieres contexto largo. Aunque solo se activen 13B por token, hay que cargar los 284B en memoria porque cualquier experto puede ser invocado.

GLM-5.2 es el caso extremo. 753B totales, 40B activos. En FP8 son unos 753 GB, así que hablamos de 4 B200 o 3 B300. En NVFP4 bajas a 377 GB y te vale con 2 tarjetas. Por eso el formato es crítico en los MoE grandes: no reduce el cómputo por token, pero sí el número de GPUs que necesitas solo para tener el modelo cargado.

4. Throughput: tokens por segundo en el mundo real

Que el modelo quepa no basta. Hay que servir peticiones a una velocidad útil, y ahí mandan el ancho de banda de memoria (HBM) y los Tensor Cores.

Throughput de inferencia en tokens por segundo por GPU, referencia de modelo 70B en FP8 con batching

La lectura corta de ese gráfico: el salto de A100 a H100 lo explica el Transformer Engine y el FP8 nativo, y el salto de Hopper a Blackwell lo explica el ancho de banda más el 4 bits. Entre generaciones contiguas la diferencia no está en los TFLOPS de catálogo, está en si la GPU habla el idioma de tu checkpoint.

El caso real: Qwen3.6 en NVFP4

Validamos estas cifras con datos de producción. Migrar nuestro checkpoint de Qwen3.6-35B-A3B de FP8 a NVFP4 en una RTX PRO 6000 (96 GB, Blackwell sm_120) nos dio esto:

MétricaFP8-TritonNVFP4Delta
Throughput total12.820 tok/s14.273 tok/s+11,3%
TPOT602 ms530 ms-12%
E2EL202 s188 s-7%
KV cache pico55%43%12 pts menos

Mismo hardware, mismo modelo, más throughput. Solo cambió el formato del checkpoint.

El detalle completo de la migración está en el post anterior , incluido el bug de cuDNN que encontramos por el camino: un kernel que elegía tilings de datacenter sm100 y escribía fuera de límites en la memoria compartida de 99 KB de sm120.

5. Qué GPU comprar o alquilar según tu caso de uso

No hay una mejor GPU. Hay una GPU adecuada para cada carga de trabajo.

Investigación, fine-tuning y pruebas de concepto

  • H100. Suficiente para casi todo y la opción natural si el uso es intermitente.
  • RTX PRO 6000. Blackwell en formato estación de trabajo. Capacidad local sin depender del cloud, con NVFP4 nativo y 96 GB.

Producción a escala con modelos compactos

Sirviendo un MoE compacto como Qwen3.6-35B-A3B:

  • H200. Sus 141 GB dan margen para KV cache larga, contextos de 256K incluidos. Sigue siendo el caballo de batalla del FP8.
  • B200 en NVFP4. Si tu modelo tiene checkpoint NVFP4, es el máximo throughput por GPU.
  • RTX PRO 6000. NVFP4 nativo con 96 GB, de sobra para modelos de este tamaño en local.

Modelos masivos: DeepSeek-V4-flash, GLM-5.2

  • Cluster de B200, 2 a 4 tarjetas. Con NVFP4, DeepSeek-V4-flash entra en 1 o 2 y GLM-5.2 en 2. Sin NVFP4 necesitas el doble.
  • B300 (Blackwell Ultra). 288 GB por GPU, así que necesitas menos tarjetas para el mismo modelo.
  • Cluster de H200. Alternativa sólida si el modelo está en FP8 y no vas a migrar.

Latencia ultrabaja: agentes de código, chat en tiempo real

Muchas peticiones pequeñas que necesitan respuesta inmediata:

  • B200 y B300. El menor TPOT gracias a los 8 TB/s de ancho de banda. Cada token llega antes.
  • H200. También excelente si el modelo es FP8.
  • Evita A100. Sus ~2 TB/s son un cuello de botella evidente en la fase de decode.

Carga mixta: IA, gráficos y virtualización

  • L40S y RTX 6000 Ada. Combinan Tensor Cores con RT Cores y salida de vídeo. Para estaciones de ingeniería, diseño o vGPU siguen siendo la opción natural. Si además quieres FP4 nativo en el escritorio, la RTX PRO 6000 Blackwell es la evolución.

6. Lo que viene: Blackwell Ultra y Vera Rubin

Blackwell Ultra (B300 / GB300), ya disponible

  • 288 GB de HBM3e por GPU a 8 TB/s, gracias a stacks de 12 alturas
  • 15 PFLOPS FP4 densos por GPU
  • GB300 NVL72: 1,1 ExaFLOPS FP4 por rack, 1,5x el GB200 NVL72
  • 1.400 W de TDP, con refrigeración líquida obligatoria

En la práctica, un modelo de unos 200B parámetros en NVFP4 cabe en una sola GPU, y para uno masivo en FP8 con 2 o 3 B300 tienes espacio de sobra incluso con KV cache larga.

Vera Rubin (R100), en producción desde junio de 2026

  • TSMC 3 nm, 336B transistores en dos dies
  • HBM4: 288 GB por GPU a 22 TB/s, 2,8x sobre Blackwell
  • 50 PFLOPS FP4 de inferencia por chip
  • Rubin NVL144: la nueva referencia de rack, unas 3,3x el rendimiento del GB300 NVL72

NVIDIA entró en producción en junio de 2026 y la disponibilidad en cloud (AWS, GCP, Azure, Oracle) llega a lo largo de la segunda mitad del año. Si estás firmando un contrato de GPU a 3 años este trimestre, ese calendario es parte de la negociación.

7. Cómo tomar la decisión, paso a paso

  1. Elige tu modelo objetivo. No "una GPU", sino "voy a servir GLM-5.2 a 200 peticiones por segundo".
  2. Elige la precisión de inferencia. FP8 es el estándar hoy. NVFP4 es la ventaja si tu hardware lo soporta.
  3. Calcula la VRAM. Peso del modelo, más KV cache (contexto por batch), más overhead de serving.
  4. Elige la GPU con Tensor Cores nativos para esa precisión. NVFP4 en Blackwell y NVFP4 emulado en Hopper no son lo mismo.
  5. Compara throughput real en tokens por segundo y VRAM efectiva, no specs de catálogo.
  6. Añade un 20-40% de margen para picos de tráfico y crecimiento.
Árbol de decisión para elegir GPU de IA según modelo, precisión y VRAM disponible

La GPU correcta te deja servir más modelo con menos hardware. La incorrecta te ata a un formato, una plataforma o una capacidad de VRAM que limita lo que puedes ofrecer durante los tres años que dura la amortización.

En Helmcode hemos procesado más de 574.000 millones de tokens, con picos de unos 14.000 millones al día. Los tres modelos de este post son justo los que más servimos, y los números están en abierto en nuestra página de datos públicos . Hemos pasado por A100, H100, Ada y ahora Blackwell, y cada salto generacional nos ha dado más capacidad sin cambiar el número de servidores. La optimización no es solo software: es saber qué hardware entiende tu modelo.

Preguntas frecuentes

¿Cuánta VRAM necesita un modelo de 70B parámetros?

En FP16 unos 140 GB, en FP8 unos 70 GB y en NVFP4 unos 35 GB, solo para los pesos. A eso hay que sumarle el KV cache, que depende del contexto y del batch, y el overhead del motor de serving. Con un 20-40% de margen encima, un 70B en FP8 pide una H200 de 141 GB o superior.

¿Puedo correr un modelo NVFP4 en una H100 o H200?

Sí, pero no deberías. Hopper no tiene Tensor Cores de 4 bits, así que emula el formato sobre FP8 o FP16. El modelo responde, pero pierdes la ventaja de throughput y de memoria que justificaba usar NVFP4.

¿Qué diferencia hay entre FP8 y NVFP4?

FP8 usa 8 bits por número y es el estándar actual en inferencia de modelos abiertos. NVFP4 usa 4 bits con escalado por bloques, ocupa la mitad y conserva mucha más precisión numérica que el viejo INT4. Solo Blackwell lo acelera en hardware.

¿La RTX PRO 6000 es Ada o Blackwell?

Blackwell. Lleva Tensor Cores de 5ª generación con NVFP4, FP6 y FP8 en hardware, y 96 GB de GDDR7. La confusión viene de la RTX 6000 Ada Generation, que es la generación anterior, tiene 48 GB y no acelera FP4.

¿Qué GPU necesito para servir un modelo MoE grande como GLM-5.2?

Aunque solo se activen 40B parámetros por token, hay que cargar los 753B en memoria. En FP8 eso son unos 753 GB, es decir 4 B200 o 3 B300. En NVFP4 bajas a 377 GB y te bastan 2 tarjetas.

¿Merece la pena comprar GPUs o alquilar inferencia por API?

Depende del uso. Con carga intermitente o variable, una API con precio plano evita amortizar hardware que está parado. Con carga sostenida y predecible, o con requisitos de residencia de datos que exijan on-premise, la compra empieza a tener sentido. El cálculo lo decide el porcentaje de utilización real, no el precio de la tarjeta.

---

*¿Necesitas GPUs para tus cargas de trabajo? Háblanos y te contamos nuestra disponibilidad de GPUs Blackwell dedicadas, o te servimos los mismos modelos directamente desde nuestra API de inferencia sin que tengas que comprar nada.*