Precio de gama media, puntuación de gama alta

Anthropic lanzó Claude Sonnet 5.5 el lunes, seis días después de su modelo estrella Opus 5.5, y sus propias cifras dejan al modelo barato dos puntos por detrás del caro en la evaluación que la empresa usa para el trabajo intelectual general. En GDPval-AA v2.1, Anthropic sitúa a Sonnet 5.5 en 1.844 frente a los 1.846 de Opus 5.5.

El precio por token no se ha movido. Sonnet 5.5 cuesta 2 dólares por millón de tokens de entrada y 10 por millón de salida, lo mismo que Sonnet 5 y la mitad de lo que cobra Opus 5.5. Las lecturas de caché siguen en 0,20 dólares por millón. El argumento de Anthropic es sobre la factura total y no sobre la tarifa: dice que el modelo genera respuestas más de un 30 por ciento más rápido y termina una tarea por hasta un 30 por ciento menos, porque gasta menos tokens y hace menos llamadas a herramientas para llegar al resultado.

Las cifras de programación se mueven mucho

En Terminal-Bench 4.0, una evaluación de programación con agentes, Anthropic sitúa a Sonnet 5.5 en el 70,6 por ciento frente al 10,3 por ciento de Sonnet 5, una diferencia que dice tanto sobre lo mal que el modelo anterior manejaba ese entorno concreto como sobre el nuevo. CursorBench 4.0 pasa del 34,1 al 55,5 por ciento, con Opus 5.5 en 57,8. FrontierCode 1.1 sube del 42,4 al 46,2 por ciento, donde Opus 5.5 sigue por delante con 54,4. En OSWorld 2.1, la prueba de uso del ordenador, Sonnet 5.5 marca 80,1 por ciento frente al 81,8 de Opus 5.5.

Puertos de un conmutador de red con cables conectados en un bastidor
El coste de inferencia es el argumento de Anthropic para el modelo. Fotografía de archivo, no de un centro de datos de Anthropic. Vladimir Srajber · pexels · Pexels License

Todas esas cifras son de Anthropic, publicadas junto al modelo y no producidas por un evaluador externo. Ninguna se ha reproducido de forma independiente todavía.

Los clientes que Anthropic cita describen la misma mejora con sus propias palabras. El vicepresidente de IA de Box dijo que el modelo era 2,4 veces más rápido y usaba un 12 por ciento menos de tokens en total. Slack informó de alrededor de un 14 por ciento menos de tokens de salida. Lovable, cuya facturación anualizada superó los 600 millones de dólares este mes, dijo que su agente de programación necesitó alrededor de un tercio menos de llamadas a herramientas para terminar un trabajo. Zendesk dijo que los tickets de soporte se procesaron un 20 por ciento más rápido.

Salvaguardas prestadas del modelo estrella

Sonnet 5.5 es el primer modelo Sonnet que llega con clasificadores destinados a impedir que alguien extraiga su razonamiento para entrenar a un rival, una defensa contra la destilación que Anthropic reservaba hasta ahora a sus modelos más grandes. Sus salvaguardas de ciberseguridad están al nivel de Opus 5.5, y Anthropic dice que las peticiones de mayor riesgo se derivan de vuelta a Sonnet 5 en lugar de ser respondidas por el modelo nuevo. Los defensores aprobados pueden solicitar acceso a la capacidad restringida a través de un Cyber Verification Program.

Dos compañeros mirando código en un monitor grande en una oficina
Anthropic dice que el modelo termina las tareas con menos tokens y menos llamadas a herramientas. Fotografía de archivo. Mikhail Nilov · pexels · Pexels License

Es una postura prudente para un modelo barato, y llega en un mes en el que agentes que corren sobre sistemas de frontera han alcanzado portales públicos de gobiernos y registros de código sin que nadie se lo pidiera.

Qué mirar ahora

El modelo está en la plataforma de Claude y en AWS, Google Cloud y Microsoft Azure como claude-sonnet-5-5. Las cifras que conviene esperar son las independientes. La afirmación de Anthropic sobre el coste por tarea depende de que el modelo decida hacer menos trabajo, y ese es precisamente el comportamiento que más varía entre el entorno de un proveedor y el código de un cliente. Las tablas públicas de programación y los índices de inteligencia pondrán número a la diferencia en cuestión de días.