Actualidad IA · PotencIA · WhatsApp y CRM

Claude Haiku 5.5 cuesta un 90 % menos, pero solo por debajo de 100.000 tokens

Anthropic lanzó Claude Haiku 5.5 el 7 de octubre a 0,10 dólares por millón de tokens. Pasados los 100.000 tokens de prompt, el precio se multiplica por cinco.

Equipo editorial de PotencIAPublicado el
Logotipo de Claude en negro macizo, centrado sobre un fondo liso blanco roto: un remolino de trazos curvos y afilados que nacen de un mismo punto y se abren hacia fuera, como los radios de un asterisco dibujado a mano alzada. No hay texto ni ningún otro elemento en la imagen.

Anthropic lanzó Claude Haiku 5.5 el 7 de octubre de 2026 y lo cobra a 0,10 dólares por millón de tokens de entrada y 0,50 por millón de salida, un 90 % menos que Claude Haiku 4.5. La letra pequeña está en una frase de la tabla de precios: esas tarifas valen para prompts de hasta 100.000 tokens, y a partir de ahí el precio se multiplica por cinco. Te toca si tu negocio tiene un asistente, un clasificador o un resumidor sobre esa API: es el modelo barato de la casa, el que suele mover el volumen, y ahora su factura depende de lo largo que sea lo que le mandas.

Las fuentes de este artículo son de Anthropic y de OpenAI, están en inglés y la traducción es propia; el original va entre comillas cuando la literalidad importa. Los cálculos que no vienen de ellas están marcados como nuestros. Al final está declarado cómo se ha leído cada fuente.

Qué ha lanzado Anthropic exactamente

Claude Haiku 5.5, el modelo pequeño de la familia, presentado en su página de anuncio del 7 de octubre de 2026 como «el modelo pequeño más barato, más rápido y más capaz que hemos publicado nunca». Está pensado, según ese mismo texto, para «tareas de gran volumen y sensibles al coste»: resúmenes, compactaciones, consultas a bases de datos y clasificación.

Las cifras salen de la ficha oficial del modelo, consultada el 8 de octubre:

  • Identificador claude-haiku-5-5, disponible en la API de Claude y también en Amazon Bedrock, Google Cloud, Microsoft Foundry y la plataforma de Claude en AWS.
  • Ventana de contexto de 1 millón de tokens y hasta 128.000 tokens de salida, frente a los 200.000 y 64.000 de Claude Haiku 4.5.
  • Razonamiento adaptativo con el parámetro de esfuerzo, con medium por defecto. Es el primer Haiku que lo trae.
  • Corte de conocimiento en junio de 2026, frente a febrero de 2025 en Haiku 4.5.
  • Estado «Active (latest)», con retirada tentativa «no antes del 7 de octubre de 2027».

El anuncio resume el ahorro así: «De media, ahora cuesta alrededor de un 75 % menos de hacer funcionar». Esa cifra, y el 90 % del titular, no son la misma cosa, y la diferencia es el resto de este artículo.

El escalón de los 100.000 tokens

Claude Haiku 5.5 es el único modelo de la gama actual que cobra según lo largo que sea el prompt. No es una lectura nuestra: está escrito en la página de precios de la plataforma, en el apartado de contexto largo. Primero la regla general:

Claude 4.6 y los modelos posteriores (excepto Claude Haiku 5.5) y Claude Mythos Preview incluyen la ventana de contexto completa de 1 millón de tokens al precio estándar. (Una petición de 900.000 tokens se factura al mismo precio por token que una de 9.000.)

Y justo después, la excepción:

Claude Haiku 5.5 se cobra por la longitud del prompt: un prompt de más de 100.000 tokens paga precios más altos.

Estas son las dos tarifas, por millón de tokens, tal como las publica la ficha del modelo. A la izquierda, prompts de hasta 100.000 tokens; a la derecha, por encima:

  • Entrada: 0,10 y 0,50 dólares.
  • Salida: 0,50 y 2,50 dólares.
  • Lectura de caché: 0,01 y 0,05 dólares.
  • Escritura de caché de 5 minutos: 0,125 y 0,625 dólares.
  • Escritura de caché de 1 hora: 0,20 y 1 dólar.
  • Por lotes, entrada y salida: 0,05 y 0,25 dólares abajo; 0,25 y 1,25 arriba.

Dos cuentas nuestras sobre esa lista, y son simples divisiones:

  1. El escalón multiplica por cinco, exactamente, las cinco tarifas. No hay ninguna partida que suba menos que las demás.
  2. Aun en el tramo alto sigue costando la mitad que Haiku 4.5, cuyas tarifas son 1 y 5 dólares de entrada y salida y 0,10 de lectura de caché. También eso es un cinco partido por diez en cada línea. Coincide con lo que Anthropic pone en la nota al pie de su anuncio: «un 90 % menos que Claude Haiku 4.5 para peticiones de hasta 100.000 tokens, y un 50 % menos para peticiones de más de 100.000 tokens».

Así que el escalón no es una trampa frente al modelo viejo. Es una trampa frente a la cifra del titular.

Por qué el nuevo tokenizador te acerca al escalón

Aquí está la parte que no se ve en la tabla. Claude Haiku 5.5 cambia de tokenizador, y la página de novedades del modelo lo dice con un número: «el mismo texto de entrada produce aproximadamente un 30 % más de tokens en Claude Haiku 5.5 que en Claude Haiku 4.5», y «el aumento exacto depende del contenido».

Cálculo nuestro, y es una estimación porque parte de ese «aproximadamente»: si 100.000 tokens nuevos equivalen a unos 77.000 tokens viejos, entonces un prompt que medías en 77.000 tokens o más con Haiku 4.5 cae ya en el tramo caro de Haiku 5.5 sin que hayas añadido una sola palabra. Cien mil partido por 1,30 son 76.923.

Y hay un segundo detalle que conviene comprobar en lugar de suponer: la documentación fija el tramo por «la longitud del prompt», pero no deja escrito cómo cuentan en ese total los tokens que ya tienes en caché. Si tu prompt ronda la línea, la guía de recuento de tokens y el aviso de la propia guía de migración —«cuenta tus prompts con model puesto en claude-haiku-5-5 en vez de reutilizar los recuentos medidos en Claude Haiku 4.5»— valen más que cualquier regla de tres.

Dos ejemplos con números, y las cuentas a la vista

Los dos supuestos son nuestros, los precios son los publicados y el 30 % extra de tokens es el que declara Anthropic. Son peticiones sueltas, sin caché, para que se vea el mecanismo.

Por debajo del escalón. Una petición que en Haiku 4.5 medía 10.000 tokens de entrada y 300 de salida costaba 0,0115 dólares. El mismo texto en Haiku 5.5 son unos 13.000 y 390 tokens, y cuesta 0,0015 dólares. Es un 87 % menos. Aquí el titular se cumple de sobra, incluso pagando el 30 % de tokens de más.

Cruzando el escalón. Una petición que en Haiku 4.5 medía 85.000 tokens de entrada y 500 de salida costaba 0,0875 dólares. En Haiku 5.5 ese mismo texto son unos 110.500 tokens de entrada, que pasan de 100.000, así que paga el tramo alto: 0,0569 dólares. Sigue siendo un 35 % menos que antes, pero está a cinco veces de distancia de lo que habría costado en el tramo bajo, que son 0,0114 dólares.

Esa es toda la historia en una frase: entre un lado y otro de la línea hay un factor cinco, y el tokenizador nuevo empuja hacia el lado caro.

Hay una tercera cuenta que explica el hueco entre el 90 % y el 75 % del anuncio. Anthropic publica que, en Haiku 4.5, «el 90 % de las peticiones» caían por debajo de los 100.000 tokens. Si se pondera solo por número de peticiones, 0,9 por 0,10 más 0,1 por 0,50 da 0,14, es decir un 86 % de ahorro. Que la empresa publique un 75 % de media quiere decir que los otros once puntos se los comen el tokenizador y el hecho de que las peticiones largas, aunque sean una de cada diez, consumen muchos más tokens que las cortas. Esa ponderación es nuestra lectura de sus dos cifras, no una cifra suya.

El mismo precio que el modelo barato de OpenAI, con el escalón en otro sitio

Esta comparación es una síntesis nuestra de dos documentaciones oficiales, y sale redonda. Según la ficha de GPT-6 Luna para desarrolladores, consultada el 8 de octubre, el modelo barato de OpenAI cobra 0,10 dólares por millón de tokens de entrada, 0,50 de salida, 0,01 de entrada en caché y 0,125 de escritura de caché. Son las cuatro cifras de Claude Haiku 5.5 en su tramo bajo, una por una.

Lo que no coincide es el escalón, y ahí hay dos diferencias que deciden a quién le conviene cada uno:

  • Dónde empieza. La ficha de OpenAI lo pone en «más de 272.000 tokens de entrada». La de Anthropic, en más de 100.000. El tramo barato de Luna llega casi tres veces más lejos.
  • Cuánto sube. OpenAI escribe que los prompts por encima de su umbral «se cobran a 2 veces las tarifas de entrada y de caché y a 1,5 veces la de salida, para la petición completa». Anthropic multiplica por cinco las dos. El castigo de Luna es menos de la mitad de duro.

Traducido a una decisión: si tus peticiones son cortas, da igual, cuestan lo mismo en los dos sitios y manda la calidad. Si mandas documentos largos, el sitio de la línea importa más que la tarifa de partida. Cuando OpenAI bajó estos precios lo contamos en OpenAI parte por la mitad el precio de su API con GPT-6 Sol y Luna; lo que ha pasado ahora es que Anthropic ha igualado la tarifa de entrada y ha puesto la puerta de salida más cerca.

Qué no cambia

Haiku 4.5 no se apaga la semana que viene. En la página de retirada de modelos, consultada el 8 de octubre, claude-haiku-4-5-20251001 figura todavía como «Active», con la columna de obsolescencia en «N/A», es decir sin fecha de obsolescencia anunciada. La misma página promete avisar «con al menos 60 días de antelación antes de la retirada de un modelo» publicado.

Eso sí, conviene leer dos cosas de esa tabla sin adornarlas. La primera es que la retirada tentativa de Haiku 4.5 figura como «no antes del 15 de octubre de 2026», o sea dentro de una semana: el suelo de un año que tenía por haber salido el 15 de octubre de 2025 se agota ya, aunque no haya ninguna fecha puesta. La segunda es que su propia ficha lo encabeza con la etiqueta «Legacy», que en el vocabulario de la casa significa que «el modelo no recibirá más actualizaciones y puede quedar obsoleto en el futuro». Nuestra lectura, y es lectura: no hay urgencia esta semana, pero tampoco queda un año de colchón por escrito, así que esto se mira en el próximo mantenimiento y no en marzo.

Un matiz más de esa misma página, que afecta a quien no llama a la API directamente: las fechas valen para las plataformas que opera Anthropic —la API de Claude, la plataforma en AWS y Microsoft Foundry—, mientras que «las plataformas operadas por socios (Amazon Bedrock y Google Cloud) fijan sus propios calendarios de retirada».

La ventana de contexto completa no se cobra aparte. El millón de tokens está disponible sin recargo por tramo de ventana; lo que hay es un precio distinto según el prompt, que es otra cosa.

El techo de salida no se mueve con el escalón. Son 128.000 tokens en los dos tramos.

Los límites de biología son los de siempre. El anuncio dice que las salvaguardas de biología de Haiku 5.5 «son las mismas que para Sonnet 5, Sonnet 5.5 y Opus 5». Las de ciberseguridad sí cambian: son «más restrictivas que las de Haiku 4.5», algo menos que las de otros modelos recientes, y siguen bloqueando «las pruebas de penetración y otras técnicas con más probabilidad de ser usadas por atacantes».

Qué se te puede romper al cambiar el identificador

La guía de migración lo ordena en una lista de diez pasos para quien viene de Haiku 4.5. Cuatro devuelven error 400 y no hay forma de que pasen desapercibidos:

  1. Razonamiento manual. Si mandas thinking con budget_tokens, falla. Hay que cambiarlo por el modo adaptativo.
  2. Parámetros de muestreo. Hay que quitar temperature, top_p y top_k. La guía detalla que si va temperature tiene que valer 1 y si va top_p tiene que valer 0,99, y que cualquier otro valor devuelve error 400, «incluido un top_p de 1», igual que mandar los dos juntos.
  3. Respuestas empezadas. El truco de dejar un turno del asistente al final de messages para que el modelo lo continúe ahora devuelve error 400, «incluso con el razonamiento desactivado». La guía propone salidas estructuradas o herramientas con campos de enumeración para lo que antes resolvía ese truco.
  4. Uso del ordenador. En la API de Claude y en Google Cloud hay que pasar de computer_20250124 al conjunto computer_toolset_20260801.

Y hay dos cambios que no dan error y por eso duelen más: la respuesta puede empezar con bloques de razonamiento, así que el código que lee el primer bloque como si fuera la respuesta devolverá basura; y el modelo ejecuta clasificadores de seguridad que pueden rechazar una petición con stop_reason: "refusal", sin recurso automático en el servidor. Cómo se factura eso lo contamos en Claude empieza a cobrar los rechazos de su API.

Un último aviso de la guía que solo afecta a quien tenga contrato de capacidad: «el nivel prioritario no está soportado en Claude Haiku 5.5». El patrón de roturas es casi el mismo que trajo el modelo mediano hace diez días, y ahí está desarrollado paso a paso: Claude Sonnet 5.5 mantiene el precio por token y trae cinco cambios que pueden romper tu automatización.

Las otras dos rebajas del mismo día

El anuncio trae dos cosas más que cambian coste o acceso, y ninguna tiene que ver con Haiku.

La lectura de caché de Sonnet 5.5 baja a la mitad. De 0,20 a 0,10 dólares por millón de tokens. Anthropic calcula que, «como las lecturas de caché suponen una parte grande del consumo de tokens de los modelos, esto reduce el coste de Sonnet 5.5 en la mayoría de tareas agénticas en torno a un 20 %». La página de precios lo recoge ya como el 5 % del precio base de entrada en lugar del 10 %.

Los planes Max y Team incluyen crédito mensual de API. La página de condiciones da las cantidades: 100 dólares al mes en Max 5x, 200 en Max 20x y, en Team, 20 por plaza estándar y 100 por plaza premium, agrupados en un saldo común con un tope de 500. Esto es lo que interesa de verdad a un negocio pequeño que quiera probar algo sin abrir una cuenta nueva, y lo que la nota de prensa no subraya está en la letra pequeña de esa página:

  • Los planes Free, Pro y Enterprise no son elegibles. Solo Max 5x, Max 20x y Team.
  • No hace falta añadir un método de pago en la plataforma para gastarlo.
  • Caduca al final de cada ciclo de facturación, sin arrastre. Lo que no gastas, se pierde.
  • No cubre Claude Code ni el consumo extra de las aplicaciones de Claude. Cubre la API, los agentes gestionados, el SDK y el laboratorio de pruebas.
  • No vale en Amazon Bedrock, Google Cloud ni Microsoft Foundry, solo en la API dentro de la consola de Claude.
  • Quien acabe de suscribirse puede reclamarlo después de 7 días en un plan elegible.

El anuncio dice que el crédito se despliega «esta semana», así que puede que todavía no esté en tu cuenta.

Ejemplo: la clínica que resume historiales

Una clínica dental con tres sillones tiene un asistente que hace dos cosas distintas con la misma API. Una es clasificar los mensajes que entran por WhatsApp: cada petición son unos pocos miles de tokens y hay cientos al día. La otra es preparar un resumen del historial de un paciente antes de la visita, y ahí el prompt se va a decenas de miles de tokens porque lleva adjuntos.

Con las tarifas de arriba, la decisión no es «cambio de modelo» o «no cambio», es que las dos tareas van por caminos distintos:

  • La clasificación se lleva el 90 % de descuento entero. Son prompts cortos, muy por debajo de los 100.000 tokens, y además la lectura de caché cae de 0,10 a 0,01 dólares por millón, que es diez veces menos para la parte del prompt que se repite en cada mensaje. Es el caso de libro del modelo nuevo.
  • El resumen de historiales es donde hay que medir antes de tocar nada. Si hoy esos prompts rondan los 70.000 u 80.000 tokens contados con Haiku 4.5, el 30 % extra del tokenizador nuevo los pone por encima de 100.000 y pasan a pagar cinco veces más por token que la tarea de al lado. Sigue siendo más barato que antes, pero no es el ahorro que pone el titular.

La salida práctica no es renunciar al modelo: es mirar si ese resumen necesita de verdad el historial completo en un solo prompt o si se puede partir en dos llamadas por debajo de la línea. Y, en una clínica, hay una razón anterior al precio para no mandar el historial entero: solo debería ir lo que hace falta para la tarea. Es el mismo criterio que aplicamos a lo que se guarda de una conversación, y está desarrollado en qué datos personales debería guardar un CRM y con qué criterio.

Análisis de PotencIA

Este apartado es criterio propio, separado a propósito de la documentación citada arriba.

Lo que nos parece más relevante de este lanzamiento no es el 90 %, es que el precio ha dejado de ser un número y ha pasado a ser una función de cómo esté construido tu prompt. Hasta ahora, en esta gama, presupuestar una automatización era multiplicar tokens por una tarifa. Con un escalón de por medio hay que saber además en qué lado de los 100.000 cae cada tipo de petición, y eso no se sabe sin medirlo.

De ahí sale el criterio que nos llevamos al trabajo: la longitud del prompt es ahora una decisión de arquitectura, no un detalle de implementación. Un asistente que mete el catálogo entero, el historial completo y veinte ejemplos en cada llamada «porque entra en el millón de tokens» puede estar pagando cinco veces más por token que el mismo asistente con la información recortada a lo que la tarea pide. La ventana de 1 millón invita a lo primero y la tabla de precios castiga exactamente eso. Nos parece una tensión incómoda y vale la pena decirla en voz alta.

Hay una segunda cosa que conviene leer con calma, porque el anuncio empuja al revés. Las seis empresas que aparecen citando mejoras en el anuncio están contando pruebas internas hechas antes del lanzamiento y recogidas por el fabricante. Son útiles para saber para qué lo usa alguien, no para dar por bueno un número en tu caso. La única evidencia que sirve para decidir es la factura de tu propio tráfico, y por eso la primera tarea de abajo es recontar y no migrar.

Y la tercera, sobre a quién le toca esto de verdad. Si tu negocio usa Claude desde la aplicación o desde la web, nada de este artículo te afecta: estos precios son de la API. Lo que sí te puede tocar, y es la novedad más accesible del día, es el crédito mensual de los planes Max y Team, que convierte «probar a montar algo» en una tarde sin tarjeta. Cuando esa prueba se convierte en algo que atiende clientes, lo que nosotros montamos sobre esta clase de modelos está en cómo funciona PotencIA, y lo que cuesta sostenerlo al mes, con sus partidas, en cuánto cuesta un CRM conversacional en España en 2026.

Qué hacer esta semana

Tres cosas, por orden, y ninguna es cambiar el identificador el primer día.

  1. Recuenta tus prompts con el modelo nuevo. No reutilices los recuentos de Haiku 4.5: lo pide la propia guía de migración. Lo que buscas es una sola cifra por cada tipo de petición que haces, y si alguna pasa de 100.000 tokens.
  2. Separa las peticiones cortas de las largas. Las cortas se pueden mover ya y se llevan el descuento entero. Las que rondan la línea merecen una decisión aparte: partirlas, recortar lo que mandas o quedarse en Haiku 4.5 mientras siga activo.
  3. Si pagas Max o Team, reclama el crédito. Son entre 100 y 500 dólares al mes que caducan cada ciclo y no se arrastran. Si no los vas a usar, al menos conviene saber que están.

Y una que no es de esta semana, pero que no conviene olvidar: Haiku 4.5 no tiene fecha de retirada, pero su suelo tentativo se agota el 15 de octubre. Dejarlo apuntado en el mantenimiento del mes es más barato que enterarse cuando llegue el aviso de 60 días.

Cómo se ha verificado esto

El barrido de fuentes primarias se hizo el 8 de octubre de 2026 entre las 09:45 y las 10:05 CEST, con ventana de 24 horas y sin necesidad de ampliarla a 72.

La página de anuncio de Claude Haiku 5.5 respondió a la lectura automatizada directa y de ahí se sacó el texto; después se volvió a abrir con un navegador real para el repaso final, y las dos lecturas coinciden. Lleva la fecha «October 7, 2026» en cabecera. De ahí salen las frases entrecomilladas del anuncio, las dos notas al pie, la tabla comparativa de precios con Haiku 4.5 y Sonnet 5.5, y los párrafos de ciberseguridad, biología, crédito de API y rebaja de la caché de Sonnet 5.5.

Las cifras técnicas y de precio se contrastaron contra cinco páginas de la documentación de la plataforma de Claude, todas consultadas el 8 de octubre y todas servidas en texto: la ficha del modelo Haiku 5.5, la de Haiku 4.5, las notas de versión de la plataforma —que fechan el lanzamiento el 7 de octubre—, la guía de migración, la página de precios y la de retirada de modelos. Las dos tarifas por tramo y la frase sobre la excepción de Haiku 5.5 en el contexto largo aparecen en la página de precios y en la ficha del modelo, con los mismos números.

Los precios de GPT-6 Luna se leyeron el 8 de octubre en su ficha de la documentación para desarrolladores de OpenAI, que es la que incluye la frase sobre el umbral de 272.000 tokens de entrada, y se cruzaron con la tabla de precios estándar del mismo dominio, donde las columnas de contexto corto y contexto largo dan las mismas cifras.

Lo que es cálculo o criterio propio de PotencIA está marcado como tal en el texto: la equivalencia de los 100.000 tokens en unos 77.000 tokens medidos con el tokenizador anterior, que es una estimación porque el 30 % que publica Anthropic es aproximado; los dos ejemplos numéricos, con sus supuestos a la vista; la ponderación que explica el hueco entre el 90 % y el 75 % del anuncio; la comparación línea a línea con GPT-6 Luna; la lectura de la etiqueta «Legacy» y del suelo del 15 de octubre de Haiku 4.5; la advertencia de medir cómo cuentan los tokens en caché para el tramo, que la documentación no deja escrito; y el ejemplo de la clínica dental, que es un caso construido y no un cliente real. Las seis empresas citadas en el anuncio lo son por el fabricante y aquí no se presentan como evidencia independiente. La revisión humana de esta pieza es posterior a su publicación.