Una décima parte del precio

Anthropic lanzó Claude Haiku 5.5 el 7 de octubre y lo describe como el modelo pequeño más barato, más rápido y más capaz que ha publicado.

El precio es la noticia. Para avisos de hasta 100.000 tokens, la entrada cuesta 0,10 dólares por millón de tokens y la salida 0,50. Haiku 4.5 cobraba 1,00 y 5,00 dólares, diez veces más. Por encima de 100.000 tokens de aviso, el nuevo modelo cobra 0,50 y 2,50, todavía la mitad de la tarifa anterior. Las lecturas de caché bajan de 0,10 a 0,01 dólares, y las escrituras de 1,25 a 0,125.

Anthropic sitúa el ahorro medio en torno al 75%, con una nota al pie que resuelve la aritmética: un 90% menos para peticiones por debajo de 100.000 tokens y un 50% menos por encima. El precio de lectura de caché de Sonnet 5.5 también se redujo a la mitad en el lanzamiento, de 0,20 a 0,10 dólares.

Qué dice Anthropic que puntúa

Todas las cifras siguientes proceden del fabricante, de evaluaciones propias de Anthropic, y ninguna ha sido reproducida de forma independiente.

En OSWorld 2.1, la tabla de la compañía da a Haiku 5.5 un 72,4% frente a un 15,7% de Haiku 4.5 y un 48,9% de GPT-6 Luna, de OpenAI. En Terminal-Bench 4.0 da un 39,2%, frente a un 0,0% de Haiku 4.5 y un 16,4% de GPT-6 Luna. En Humanity’s Last Exam sin herramientas informa de un 45,9%, frente al 10,2% anterior.

Una mano usa una calculadora sobre una hoja impresa con tipos de gráfico
La entrada baja de 1,00 a 0,10 dólares por millón de tokens en avisos cortos. Imagen ilustrativa. RDNE Stock project · pexels · Pexels License

Sonnet 5.5 sigue por encima en todas las líneas —83,9% en OSWorld, 70,6% en Terminal-Bench—, que es el sentido de la gama y no un desdoro. Se citan dos clientes: Box informó de una puntuación 11 puntos superior a la de Haiku 4.5 con aproximadamente la mitad de latencia, y AlphaSense de un 0,84 frente a un 0,76 en su propia evaluación Ask in Document.

Un mando de esfuerzo en un modelo pequeño

Haiku 5.5 es el primer modelo de la clase Haiku con ajuste de esfuerzo, el control que permite a quien llama cambiar gasto por cuánto trabaja el modelo en una petición. Hasta ahora era una característica de los modelos Claude grandes.

Eso importa más de lo que parece para el trabajo que se le vende a Haiku: clasificar, extraer, encaminar, resumir un millón de veces el mismo tipo de documento. Un modelo barato con un mando puede ajustarse por cola de trabajo y no por aplicación.

Cables de fibra óptica conectados a un panel en un centro de datos
El modelo corre en AWS, Google Cloud, Azure y la plataforma propia de Anthropic. Imagen ilustrativa. Brett Sayles · pexels · Pexels License

La nota al pie del precio

Un detalle suaviza la cifra del titular. Haiku 5.5 usa un tokenizador actualizado, y Anthropic dice que consume algo más de tokens por tarea que su predecesor. Un recorte medido por token no es exactamente un recorte medido por trabajo, y quien calcule el ahorro debería medirlo con su propio tráfico.

Anthropic añade que las salvaguardas de ciberseguridad del modelo son más estrictas que las de Haiku 4.5 pero más laxas que las de Sonnet 5.5, e informa de mejoras de alineamiento sobre la versión anterior sin ponerles número. No indica la ventana de contexto.

Dónde se ejecuta y qué vigilar

El modelo está disponible ya en Amazon Web Services, Google Cloud y Microsoft Azure, además de la plataforma propia de Anthropic.

Lo que conviene vigilar es si el suelo de los modelos pequeños sigue bajando. Anthropic ha colocado a Haiku 5.5 en el mismo terreno que GPT-6 Luna, de OpenAI, y la API de decisiones que OpenAI lanzó esa misma semana cobra 0,10 dólares por millón de tokens de entrada con salida gratuita. El escalón barato es donde está el volumen, y ambos laboratorios parecen fijarlo ahora como posición y no como margen.