Sonnet 5.5 vs Opus 5.5: la cuenta por tarea que cambia tu factura
Sonnet 5.5 vs Opus 5.5: la cuenta por tarea, el dial de esfuerzo, el caché y cuándo no conviene migrar. Cifras de Anthropic, con salvedades.
Sonnet 5.5 vs Opus 5.5 es la comparación que importa desde el 28 de septiembre de 2026, cuando Anthropic lanzó Claude Sonnet 5.5 al mismo precio de lista que Sonnet 5: 2 dólares por millón de tokens de entrada y 10 de salida. Lo que cambió es cuánto trabajo hace por ese dinero, y la regla práctica es usar Sonnet por defecto y Opus solo cuando Sonnet falle en tus propias pruebas.
Qué cambió con Sonnet 5.5 frente a Sonnet 5
Anthropic dice que el modelo responde más de 30 % más rápido y que termina una tarea gastando hasta 30 % menos. Trae un millón de tokens de contexto y está en las apps de Claude, en Claude Code y en la nube de Amazon, Google y Microsoft. Ojo: ese 30 % es un máximo, no un promedio prometido.

Precio por token contra costo por tarea
Comparamos modelos por precio por token, pero nadie paga tokens: paga tareas. Es como el coche: el precio del litro no dice nada si no sabes cuántos kilómetros rinde. Balyasny, una firma de inversión, corrió 2,441 tareas de finanzas. Con el modelo anterior, cada respuesta consumió 497,000 tokens; con Sonnet 5.5, 121,000.
Con una cuenta simplificada, todo a precio de entrada, eso es casi un dólar por respuesta contra 24 centavos. Multiplicado por las 2,441 tareas: 2,426 dólares contra 591. La encuesta de Sapio Research para DoiT, a 500 líderes de finanzas, encontró que 79 % tuvo sobrecostos de IA en los últimos doce meses y solo 15 % puede calcular su retorno sin cuellos de botella importantes.
Sonnet 5.5 vs Opus 5.5: qué dicen las pruebas
Frente a Sonnet 5, la mejora es grande: en Terminal-Bench 4.0 pasa de 10 % a 70 %, y en la prueba de uso de computadora OSWorld, de 57 % a 80 %. Frente a Opus 5.5, que cuesta el doble por token, queda muy cerca en trabajo de oficina: 1844 puntos contra 1846. En Terminal-Bench incluso lo supera, 70.6 contra 66.4, aunque Opus se midió a esfuerzo extra alto.
¿Para qué usar entonces Opus? Según Anthropic, sigue siendo claramente superior en trabajo abierto que exige juicio sostenido: en FrontierCode saca 54.4 contra 46.2. Si tu tarea tiene alcance claro, pagar el doble por una diferencia de dos puntos en trabajo de oficina es pagar por algo que no usas.
Las tres palancas de la factura
El dial de esfuerzo. Hay cinco niveles: bajo, medio, alto, extra alto y máximo. Anthropic afirma que en Terminal-Bench, a esfuerzo medio, supera el mejor resultado del modelo anterior por menos de una décima parte del costo por tarea. Los niveles se recalibraron, así que el ajuste anterior ya no significa lo mismo. La recomendación oficial es empezar en alto, o en medio para agentes con tareas bien definidas, y medir.
El caché. Un agente que carga 40,000 tokens de manual en cada consulta, mil veces al día, gasta unos 80 dólares sin caché. Con caché, leerlos cuesta 20 centavos por millón: unos 8 dólares más 10 centavos por escribirlo una vez. Es una estimación propia con precios oficiales, y depende de que el caché siga vivo entre consultas.
Los lotes. Si tu trabajo puede esperar, la interfaz por lotes cobra la mitad.
Cómo migrar tu aplicación
Cambias el nombre del modelo, una sola línea, y corres tus pruebas. Si mandabas temperatura o top-p distintos del predeterminado, la interfaz responde con un error 400. Si forzabas el uso de una herramienta, también falla: ahora lo pides en el prompt y dejas el modo automático. Si apagabas el pensamiento con el valor disabled, ahora usas between_tools.
Lo que puede fallar
- Si tu app muestra el texto que el modelo escribe entre llamadas a herramientas, puede quedarse callada sin error: ahora llega en bloques de pensamiento, vacíos por defecto.
- Los niveles de esfuerzo cambiaron y la configuración heredada puede pensar más o menos de lo que crees.
- Los bloques de pensamiento quedan atados al modelo y a la cuenta que los produjo: si cambias a Opus a mitad de conversación, ese razonamiento se pierde.
- En tareas de ciberseguridad de mayor riesgo, el sistema cae visiblemente a Sonnet 5.
¿Cómo aplicarlo en tu empresa?
Elige 50 tareas reales con un criterio claro de éxito, córrelas en tu modelo actual y en Sonnet 5.5 a esfuerzo medio y alto, y registra tokens, pasos y aciertos. Calcula el costo por tarea terminada, contando reintentos, y decide con tus números. Los casos ideales son documentos en lote (Zendesk reportó tickets procesados 20 % más rápido; Box, 2.4 veces más rápido y 12 % menos de tokens) y agencias que construyen apps (Base44 midió 3.6 iteraciones en promedio contra 7.7 de Opus 5). Ese último dato es una comparación con Opus 5, no con 5.5, y la mide el cliente.
Para la versión corta, lee el análisis completo en formato Short de Claude Sonnet 5.5.
Preguntas frecuentes
¿Cuánto cuesta Sonnet 5.5?
2 dólares por millón de tokens de entrada y 10 de salida, igual que Sonnet 5.
¿Sonnet 5.5 es mejor que Opus 5.5?
No en todo. Casi empata en trabajo de oficina (1844 contra 1846), pero Opus sigue siendo superior en trabajo abierto que exige juicio sostenido.
¿Cuándo conviene usar Opus 5.5?
Cuando Sonnet 5.5 falla en tus propias pruebas, no cuando suena más impresionante.
¿Las cifras son independientes?
No. Casi todas salen de Anthropic y de sus propios clientes, y ninguna fue repetida por terceros.
Conclusión
En Sonnet 5.5 vs Opus 5.5, el precio de lista no cambió pero la cuenta sí: menos tokens, menos pasos, esfuerzo ajustable y caché. Todo se nota en la factura, pero solo si lo mides. No compares precio por token: compara costo por tarea.