Meta publicó Muse Spark 1.3 el 2 de septiembre. OpenAI sacó GPT-6 Astra el 3. Anthropic actualizó a Claude Fable 5.1 el mismo día. Con Google ya en la conversación con Gemini 3.8 Flash, los cuatro laboratorios frontera movieron ficha en menos de una semana.
Si operas agentes en producción, el número de los titulares no es el que te va a doler.
Arriba están casi empatados
| Modelo | Laboratorio | Índice | Coste por tarea |
|---|---|---|---|
| Claude Fable 5.1 | Anthropic | 65,7 | 3,76 USD |
| GPT-6 Astra | OpenAI | 61,2 | no publicado |
| Muse Spark 1.3 (xhigh) | Meta | 61,0 | 0,55 USD |
| Gemini 3.8 Flash | 59,0 | 0,58 USD |
Los cuatro caben en menos de siete puntos. Para la mayoría de tareas de un agente de negocio (entender un pedido, consultar disponibilidad, redactar una respuesta) esa distancia no se nota.
Abajo se separan casi siete veces
Claude Fable 5.1 encabeza el índice por 4,7 puntos sobre Muse Spark 1.3, y cuesta 6,8 veces más por tarea: 3,76 dólares frente a 0,55. Esa proporción no es un detalle de la factura; es la diferencia entre un agente que puedes dejar corriendo y uno que hay que racionar.
Conviene leer las cifras con cuidado. El coste de Fable 5.1 está medido a máximo esfuerzo, y el de Meta corresponde a su variante xhigh. Los laboratorios publican familias, no modelos sueltos: bajo un mismo nombre comercial conviven configuraciones con precios muy distintos, y comparar sin mirar cuál se midió lleva a conclusiones falsas.
El índice general no predice el trabajo agéntico
Artificial Analysis publica también un índice agéntico, y ahí las posiciones se mueven. GPT-6 Astra baja de 61,2 a 51,5. Claude Fable 5.1 baja de 65,7 a 61,3. Uno pierde casi diez puntos al pasar del examen a la tarea larga con herramientas; el otro pierde cuatro.
Un agente de verdad vive en el segundo escenario: encadena llamadas, se equivoca, reintenta y arrastra contexto durante muchos turnos. Elegir por el titular es elegir por el examen equivocado.
Qué hacemos con esto
Nada de esto se decide una vez ni para toda la empresa: se decide por proyecto y con números propios. El AI Development OS registra el costo de cada llamada a un modelo, así que la comparación no queda entre dos posts de lanzamiento, sino entre lo que cuesta hoy atender una conversación real con uno u otro. Cambiar de modelo pasa a ser una decisión con evidencia.
Es la misma razón por la que entrar al programa de partners de OpenAI no nos ata a un proveedor: la maquinaria que mide es agnóstica a propósito.
Y el índice no es lo único que se mueve en un lanzamiento. Fable 5.1 llegó además con tres cambios de API que rompen código que ya funcionaba, y el peor de los tres no devuelve error.
La semana que viene el ranking será otro. Lo que no cambia son las tres preguntas: cuánto cuesta, cuánto aguanta encadenando herramientas, y quién responde cuando falla.
¿Quieres ver esa comparación sobre tu propia operación? Hablemos.