Claude Sonnet 5 salió y el titular es que cuesta menos que el Sonnet anterior. Eso es cierto en el precio por token y engañoso en la factura, por una razón que casi nadie está explicando.
Aquí van los números reales, dónde queda contra Opus 4.8, y los tres cambios de comportamiento que van a romper código que hoy funciona.
Los precios, tal como están publicados
Sonnet 5 cuesta $2 dólares por millón de tokens de entrada y $10 por millón de salida. Sonnet 4.6 costaba $3 y $15.
Ese precio nació como promocional con fecha de caducidad y Anthropic lo dejó fijo: el aumento programado a $3/$15 no va a ocurrir. Es el precio estándar.
Para ubicarlo en la escalera completa, por millón de tokens de entrada y de salida:
- Claude Haiku 4.5 — $1 / $5
- Claude Sonnet 5 — $2 / $10
- Claude Sonnet 4.6 — $3 / $15
- Claude Opus 5 y Opus 4.8 — $5 / $25
- Claude Fable 5 — $10 / $50
Con la API por lotes se paga la mitad: Sonnet 5 queda en $1 y $5. Y una lectura de caché cuesta la décima parte de la entrada, o sea $0.20 por millón. Esos dos descuentos se acumulan y son la diferencia entre una factura razonable y una absurda en cualquier flujo con volumen.
La trampa: el tokenizador nuevo
Aquí está lo que hay que entender antes de presupuestar nada.
Sonnet 5 usa un tokenizador distinto al de Sonnet 4.6. El mismo texto produce aproximadamente 30% más tokens. El porcentaje exacto depende del contenido.
Haz la cuenta. La entrada bajó de $3 a $2 por token, un 33% menos, pero el mismo documento ahora son 30% más tokens. Eso deja el costo de una petición equivalente en algo muy parecido a lo que pagabas antes, no en un tercio menos. En la salida el descuento sí se nota más, porque el número de tokens de salida lo controlas tú con lo que pides.
Y hay tres consecuencias más allá de la factura:
- Tu ventana de contexto rinde menos texto. Sigue siendo de 1 millón de tokens, pero cada token cubre menos texto, así que el mismo millón te alcanza para menos documento.
- Tus límites de salida se quedan cortos. Si tenías un tope de tokens ajustado a lo que producía Sonnet 4.6, la misma respuesta se te va a truncar. El techo de salida es de 128 mil tokens.
- Tus conteos viejos ya no sirven. Cualquier estimación calibrada contra el modelo anterior hay que volverla a medir.
El paso que todo mundo se salta: volver a medir antes de migrar, no después. Toma tus diez prompts más usados, cuéntalos contra Sonnet 5 y compara con lo que gastabas. Es media hora de trabajo y es la diferencia entre saber qué va a costar tu operación y enterarte a fin de mes.
Cómo se para contra Opus 4.8
La afirmación de Anthropic es que el desempeño de Sonnet 5 queda cerca del de Opus 4.8 a un precio bastante menor, y que es una mejora sustancial sobre Sonnet 4.6 en razonamiento, uso de herramientas, código y trabajo de conocimiento.
Las dos evaluaciones que citan por nombre son BrowseComp, que mide búsqueda agéntica, y OSWorld-Verified, que mide uso de computadora. En las dos, Sonnet 5 mejora sobre Sonnet 4.6. Contra Opus 4.8, el argumento no es que empate: es que cubre un rango de costo-desempeño mucho más amplio, con una eficiencia notablemente mejor en el nivel de esfuerzo medio.
No voy a poner cifras de esos benchmarks porque el anuncio no publica una tabla de puntajes; los resultados detallados viven en el hub de transparencia de Anthropic. Un número inventado aquí no le sirve a nadie.
Dos cosas más del anuncio que sí son concretas y sí cambian decisiones: Sonnet 5 alucina y adula menos que Sonnet 4.6, y su desempeño en tareas de ciberseguridad ofensiva es sustancialmente menor al de Opus 4.8 —lo cual es una decisión de diseño, no una carencia.
El criterio práctico
Sonnet 5 es el default sensato para casi toda la producción: volumen alto, tareas de negocio, agentes que corren seguido. Opus 4.8 y Opus 5 se justifican en lo más difícil y largo, donde la diferencia de capacidad se paga sola. Fable 5, a cinco veces el precio de Sonnet 5, es para los problemas que antes no se podían atacar.
Si tu duda es entre los de arriba, eso está desarrollado en cuándo usar Claude Opus 5 y cuándo Fable 5, y la tabla completa de todos los modelos está en la hoja de referencia de modelos.
Tres cambios que rompen código
Sonnet 5 es reemplazo directo de Sonnet 4.6 —cambias el identificador del modelo y ya— pero hay tres cosas que devuelven error o cambian de comportamiento sin avisar.
1. El razonamiento viene encendido
En Sonnet 4.6, una petición sin configurar el pensamiento corría sin pensar. En Sonnet 5, esa misma petición corre con razonamiento adaptativo. Para apagarlo hay que pedirlo explícitamente.
Esto importa por dinero y por truncamiento: el tope de salida cuenta el razonamiento y la respuesta juntos. Si tenías un tope ajustado a un flujo sin pensamiento, ahora se te corta a media respuesta.
2. Los presupuestos manuales de pensamiento ya no existen
Pedir razonamiento con un número fijo de tokens devuelve error. Estaba marcado como obsoleto en Sonnet 4.6 y en Sonnet 5 se eliminó. El reemplazo es el razonamiento adaptativo más el parámetro de esfuerzo, que va de bajo a máximo.
3. Los parámetros de muestreo devuelven error
Poner temperature, top_p o top_k en un valor distinto al de fábrica devuelve error. Es la primera vez que pasa en la familia Sonnet. Si usabas temperatura para darle variedad creativa, esa palanca ya no está: la variación se pide en el prompt.
Y una cuarta que no es nueva pero sigue vigente: no se puede prellenar el mensaje del asistente. Eso ya no funcionaba en Sonnet 4.6.
Lo demás que conviene saber
La ventana de contexto de 1 millón de tokens es el default y también el máximo; no hay una versión más chica, y se cobra a precio estándar en toda la ventana.
Es el primer modelo de la familia Sonnet con salvaguardas de ciberseguridad en tiempo real. Una petición sobre temas prohibidos o de alto riesgo puede ser rechazada, y el rechazo llega como respuesta exitosa con una razón de parada, no como error. Si tienes código que asume que toda respuesta trae contenido, esa es la línea que hay que revisar.
Está disponible en la API de Claude, en AWS, en Google Cloud y en Microsoft Foundry, y soporta retención cero de datos para las organizaciones que lo tengan contratado. Lo único que no tiene es el nivel de servicio prioritario. En los planes de consumidor es el modelo por defecto de Free y Pro, y está disponible en Max, Team y Enterprise.
Lo que importa más que el modelo que elijas
Después de meter estos modelos en operaciones reales, el patrón es aburridamente consistente: la diferencia entre un resultado bueno y uno mediocre casi nunca es el modelo. Es el contexto.
Un Sonnet 5 con el contexto correcto —quién es el cliente, qué se decidió antes, cuál es el formato, qué está prohibido— gana sin discusión contra un modelo más caro al que le tiras una pregunta suelta. Lo he visto suficientes veces como para no dudarlo.
Subir de modelo cuesta dinero cada mes. Armar bien el contexto cuesta una tarde, una sola vez. La gente que se obsesiona con la primera decisión y no toca la segunda paga más para obtener menos.