7 de septiembre de 2026 · IA y LLM · Lectura de 5 minutos
Estaba valorando un proveedor de inferencia rápida para una carga de trabajo de agente que ejecuta un modelo abierto de clase 70B, y los tres nombres que siguen apareciendo (Groq, Together AI, Fireworks) cotizan precios por token que parecen similares a simple vista. No lo es. En los modelos de clase Llama-70B, Groq se esfuerza por $0,59 de entrada / $0,79 de salida por 1 millón de tokens, Juntos, la IA es un piso $0.88 / $0.88, y Fireworks factura una combinación ~$0,90 por 1 millón para su nivel 16–80B. Con una división realista de entrada/salida de 70/30, eso es un Brecha de $250 al mes entre Groq y Fireworks una vez que estás vendiendo mil millones de tokens, y el más barato no es automáticamente la elección correcta.
Los tres ejecutan modelos de peso abierto (Llama, Qwen, Mixtral, DeepSeek) detrás de API compatibles con OpenAI, por lo que cambiar de proveedor suele ser un cambio de URL base. Esto es lo que realmente cuesta la inferencia de clase Llama-70B en cada uno, extraído de sus propias páginas de precios:
| Proveedor | Modelo | Ingrese $/1 millón | Producción $/1 millón |
|---|---|---|---|
| Groq | Llama 3.3 70B | $0.59 | $0.79 |
| Juntos IA | Llama 3.1 70B | $0.88 | $0.88 |
| Fuegos artificiales | Nivel medio (16–80B, por ejemplo, Llama 70B) | ~$0.90 combinado | |
Groq es el más barato sobre el papel para una carga de trabajo típica en forma de chat (más tokens de entrada que salida) porque su precio de entrada está un 33% por debajo de la tarifa fija de Together. En conjunto, la IA valora los insumos y los resultados de manera idéntica, lo cual es más sencillo de pronosticar, pero cuesta más en las indicaciones con muchos insumos que la mayoría de las cargas de trabajo de RAG y agentes realmente envían. Fireworks no divide la entrada/salida en absoluto; su ~$0,90 es una tasa combinada única para toda la clase de modelo 16-80B, lo que hace que sea fácil de estimar, pero significa que no se puede optimizar reduciendo la duración de la producción como se puede hacer en Groq o Together.
El precio más bajo de Groq proviene del mismo lugar que su velocidad: hardware LPU (Unidad de procesamiento de lenguaje) personalizado creado específicamente para la generación de tokens, en lugar de GPU de uso general. Ese es también el verdadero punto de venta de Groq sobre los otros dos: cientos de tokens por segundo, mucho más de lo que normalmente ofrece el servicio basado en H100. Para un agente de voz o una interfaz de usuario de chat donde el usuario está mirando el cursor, esa diferencia de latencia es más importante que la brecha de $0,29/1 millón en los tokens de entrada. El problema: el catálogo de modelos alojados de Groq es más limitado que el de Together o Fireworks, y no ofrece capacidad dedicada ni ajustes: si el modelo que necesita no está en la lista de Groq, el precio deja de ser el factor decisivo.
Together AI ofrece el catálogo de modelos abiertos más amplio de los tres (Llama, Mixtral, Qwen, DeepSeek y más), además de ajustes y puntos finales dedicados, por lo que si el trabajo es "ejecutar mi propia variante ajustada" en lugar de "llamar a un modelo de stock", los precios y herramientas planos y fáciles de pronosticar de Together superan a la línea más estrecha y de velocidad de Groq. Fireworks se encuentra en un lugar similar: precios por token sin servidor para inicios rápidos, pero también implementación dedicada por hora de GPU para equipos que desean un rendimiento reservado y una latencia predecible a escala, que ni el catálogo fijo de Groq ni la configuración sin servidor de Together cubren de la misma manera. Ambos son los mejores valores predeterminados una vez que la carga de trabajo necesita más que "tokens más baratos para un modelo compatible".
Suponiendo una división realista de 70% de entrada/30% de salida, típica de mensajes de chat y estilo RAG:
| Fichas / mes | Groq | Juntos IA | Fuegos artificiales |
|---|---|---|---|
| 10 millones (aplicación pequeña) | $6.50 | $8.80 | $9.00 |
| 100 millones (producto estable) | $65 | $88 | $90 |
| Mil millones (agente de alto rendimiento) | $650 | $880 | $900 |
La brecha aumenta linealmente con el volumen, ya que los tres son precios puros por token sin pisos ni niveles de plan en el modelo en sí: con mil millones de tokens por mes, los $650 de Groq frente a los $900 de Fireworks es una diferencia real de $250, no un error de redondeo. Pero ninguno de estos números explica lo que sucede cuando el modelo que desea no está en el proveedor más barato, o cuando la velocidad de Groq reduce su costo efectivo en otros lugares: menos reintentos, sesiones de usuario más cortas, menos necesidad de almacenar en caché de manera agresiva solo para ocultar la latencia.
Producto sensible a la latencia (voz, chat en vivo, cualquier cosa que un usuario esté mirando mientras transmite): comience con Groq si su modelo está en su lista; la velocidad es la decisión real del producto y resulta que también es más barato. Necesita un modelo abierto ajustado o menos común, o desea capacidad dedicada con rendimiento predecible: Together AI o Fireworks, y elija según si valora más el catálogo más amplio de Together o la opción dedicada de hora de GPU de Fireworks. Ejecutar los tres uno al lado del otro tampoco es descabellado: la API compatible con OpenAI significa que el código no cambia, solo la URL base y la factura.
¿Es nuevo en los precios de IA basados en el uso? Comience con el guías gratuitas de costos de API. Para el lado del modelo cerrado de la misma decisión, ver GPT vs Claude vs Gemini: lo que realmente cuesta la misma carga de trabajo.
Tarifas verificadas con las páginas de precios oficiales de Groq, Together AI y Fireworks, verificadas por última vez el 15 de agosto de 2026. Estimaciones de referencia: la disponibilidad de modelos, los descuentos por volumen y las tarifas empresariales negociadas varían; Confirme los precios actuales antes de presupuestar.