24 · Julio · 2026  —  Nuevo modelo

Claude
Opus 5

Un modelo reflexivo y proactivo que se acerca a la inteligencia frontera de Claude Fable 5 a la mitad del precio. Estado del arte en programación agéntica y trabajo de conocimiento, con 1M de tokens de contexto, thinking activado por defecto y escalera de effort completa hasta max.

Contexto
1M tokens
Precio
$5 / $25
Salida máx.
128k tokens
Effort
5 niveles
Frontier-Bench v0.1 — ×2 sobre Opus 4.8 ARC-AGI 3 — ×3 sobre el siguiente mejor modelo CursorBench 3.2 — a 0,5% de Fable 5, mitad de coste OSWorld 2.0 — supera a Fable 5 a ⅓ del coste Zapier AutomationBench — ×1,5 al mismo coste Química orgánica — +10,2 pp Predicción de proteínas — +7,7 pp
Capacidades

No es una iteración.
Es un salto de escalón.

Anthropic describe Opus 5 como un step-change sobre Opus 4.8, no como una mejora incremental. Estas son las áreas donde la diferencia se nota sin cambiar una línea de código.

01

Programación agéntica de largo recorrido

Su punto más fuerte: features multi-archivo, refactors grandes y trabajo de principio a fin. Termina las tareas completas en lugar de dejar stubs o placeholders, y rinde mejor cuando recibe la especificación completa por adelantado y se le deja correr.

  • Multi-archivo
  • Refactors grandes
  • Sin placeholders
  • Bucles de tools extensos
02

Revisión de código y caza de bugs

Alta precisión y alto recall: encuentra bugs reales por pasada y sus hallazgos extra son mayormente problemas reales, no falsos positivos. La precisión se mantiene en niveles de effort bajos.

03

Eficiencia en effort bajo

low y medium dan calidad fuerte a una fracción de los tokens y la latencia — y por encima de los mismos niveles en Opus anteriores. Úsalos como control principal de coste.

04

Contexto largo, 1M tokens

1M de tokens es a la vez el valor por defecto y el máximo: no hay variante de contexto menor. El seguimiento de instrucciones, las llamadas a herramientas y el razonamiento se mantienen consistentes a lo largo de toda la ventana.

200k
1M

Haiku 4.5 (200k) frente a Opus 5, Sonnet 5 y Fable 5 (1M)

05

Visión

Fuerte en gráficos, documentos y diagramas, y en replicación visual de UI y frontend. Rinde al máximo cuando tiene herramientas para analizar, recortar y verificar visualmente su propio trabajo de forma iterativa.

06

Coordinación multi-agente

Coordina equipos de subagentes con patrones writer-verifier efectivos y pocos casos de agentes pisándose el trabajo. Delega con más facilidad que modelos previos: conviene poner topes.

07

Ofimática, documentos y escalado en test-time

Genera y edita hojas de cálculo multi-pestaña con fórmulas no triviales y produce presentaciones bien estructuradas. Y convierte effort adicional —hasta el nivel max— en mejores resultados de forma consistente.

  • Spreadsheets multi-hoja
  • Slide decks
  • Test-time compute scaling
  • Razonamiento profundo multi-paso
Comparativa directa

Opus 5 vs Opus 4.8

Mismo precio, misma ventana de contexto, misma salida máxima. Todo lo demás cambia — incluyendo un breaking change.

Característica Claude Opus 4.8 Claude Opus 5
ID de modelo claude-opus-4-8 claude-opus-5
Thinking por defecto Desactivado salvo que fijes thinking:{"type":"adaptive"} Activado — el modelo decide cuándo y cuánto piensa
Desactivar thinking Breaking Independiente del nivel de effort Solo con effort high o inferior. Con xhigh o max devuelve error 400
Escalera de effort low · medium · high · xhigh · max Escalera completa, con max como tramo superior explícito y sin beta header
Mínimo de prompt cacheable 1.024 tokens 512 tokens — prompts antes no cacheables ahora crean entrada, sin tocar código
Cambios de tools a mitad de conversación No — lista fija durante toda la sesión Sí (beta) añadir o quitar tools entre turnos preservando la caché
mid-conversation-tool-changes-2026-07-01
Modo fallbacks: "default" Lista de modelos mantenida por ti Sí (beta) fallbacks recomendados por Anthropic según categoría de rechazo
server-side-fallback-2026-07-01
Fast mode Research preview · $10 / $50 por MTok · ≈2,5× velocidad · solo Claude API
Corte fiable de conocimiento Enero 2026 Mayo 2026
Ventana de contexto 1M tokens 1M tokens (por defecto y máximo)
Salida máxima 128k tokens 128k tokens (300k en Batch API con beta header)
Precio $5 entrada / $25 salida por MTok $5 entrada / $25 salida por MTok (sin cambios)
Verificación del propio trabajo Requiere instrucción explícita Autónoma — las instrucciones heredadas provocan sobre-verificación
Longitud de respuesta por defecto Base Más larga — en chat, en narración agéntica y en documentos escritos a disco
Delegación a subagentes Conservadora Más proactiva — conviene poner topes deterministas

Lectura rápida: Opus 4.8 sigue disponible en todas las plataformas. La migración es cambiar el ID de modelo y revisar dos cosas: que max_tokens tenga margen (ahora incluye thinking) y que no estés desactivando thinking con effort xhigh/max.

Resultados

Estado del arte en código
y trabajo de conocimiento.

Estas son las cifras publicadas en el anuncio de lanzamiento. Se muestran como ratios relativos porque es exactamente así como Anthropic las publicó.

Código

Frontier-Bench v0.1

Supera a todos los modelos y más que duplica el rendimiento de Opus 4.8, a menor coste por tarea.

Opus 5×2,0
Opus 4.8×1,0
Razonamiento

ARC-AGI 3

Puntuación tres veces más alta que la del siguiente mejor modelo.

Opus 5×3,0
Siguiente mejor×1,0
Código

CursorBench 3.2

A effort max, queda a menos de 0,5% del pico de Fable 5 — pero a la mitad del coste por tarea.

Fable 5 (pico)100%
Opus 5 · max−0,5%

Coste por tarea: ½ del de Fable 5.

Agentes

Zapier AutomationBench

Tasa de éxito ≈1,5× la del siguiente mejor modelo al mismo coste por tarea. 100% de aprobación en el flujo de account health.

Opus 5×1,5
Siguiente mejor×1,0
Uso de ordenador

OSWorld 2.0

Supera a todos los modelos y bate el mejor resultado de Fable 5 a algo más de un tercio del coste.

Opus 5 · coste≈⅓
Fable 5 · coste

Menos es mejor: barra de coste, con resultado superior.

Ciencia

Evaluaciones internas de ciencias de la vida

Frente a Opus 4.8, en puntos porcentuales absolutos.

+10,2ppQuímica orgánica
+7,7ppPredicción de proteínas
Barrido

Mejor y más eficiente en coste

Anthropic reporta a Opus 5 como el modelo con mejor resultado y mejor relación coste/rendimiento en:

  • GDPval-AA v2Trabajo de conocimiento con valor económico
  • HLEHumanity's Last Exam
  • DeepSearchQABúsqueda e investigación profunda
  • AA Coding Agent IndexSuperior en todos los niveles de effort
Posicionamiento

Dónde encaja frente
a la competencia.

La comparación que Anthropic sí cuantifica es contra su propia frontera —Fable 5 y Mythos 5— y contra Opus 4.8. Esta es la matriz completa de modelos actuales con sus especificaciones publicadas.

Modelo Posición Contexto Salida Precio / MTok Latencia Corte
Claude Opus 5claude-opus-5 Programación agéntica compleja y trabajo empresarial 1M 128k $5 / $25 Moderada May 2026
Claude Fable 5claude-fable-5 El modelo más capaz de Anthropic con lanzamiento amplio; agentes de larga duración 1M 128k $10 / $50 Más lenta Ene 2026
Claude Mythos 5claude-mythos-5 Ciberseguridad defensiva · Project Glasswing, acceso solo por invitación 1M 128k $10 / $50 Más lenta Ene 2026
Claude Opus 4.8claude-opus-4-8 Generación anterior, sigue disponible en todas las plataformas 1M 128k $5 / $25 Moderada Ene 2026
Claude Sonnet 5claude-sonnet-5 La mejor combinación de velocidad e inteligencia 1M 128k $3 / $15 · $2/$10 hasta 31 ago 2026 Rápida Ene 2026
Claude Haiku 4.5claude-haiku-4-5 El más rápido, con inteligencia cercana a la frontera 200k 64k $1 / $5 La más rápida Feb 2025
Gana Opus 5

Coste por unidad de inteligencia

  • Se acerca a la inteligencia frontera de Fable 5 a la mitad del precio ($5/$25 frente a $10/$50).
  • En CursorBench 3.2 queda a 0,5% del pico de Fable 5 con la mitad del coste por tarea.
  • En OSWorld 2.0 supera el mejor resultado de Fable 5 a poco más de un tercio del coste.
  • Es «mucho más eficiente que otros modelos» según el propio anuncio.
  • Corte de conocimiento más reciente que cualquier otro modelo actual: mayo de 2026.
Queda por detrás

Dónde no es la mejor elección

  • Va por detrás de Mythos 5 en tareas de ciberseguridad ofensiva.
  • Va por detrás de Mythos 5 en investigación en biología.
  • Para capacidad máxima absoluta sin restricción de coste, la recomendación oficial sigue siendo Fable 5.
  • Fast mode no está en Amazon Bedrock, Google Cloud ni Microsoft Foundry — solo en la Claude API.
  • No avanza la frontera en capacidades de doble uso de riesgo, por diseño.
Control

La escalera de effort,
completa por primera vez.

El parámetro effort afecta a todos los tokens de la respuesta: texto, llamadas a herramientas y thinking. Opus 5 soporta los cinco niveles sin beta header. Por defecto la API usa high.

xhigh

Capacidad extendida para trabajo de largo recorrido.

  • Caso de uso
  • En Opus 5
  • Thinking

Empieza en xhigh

Para código y trabajo agéntico. Usa high para el resto de cargas sensibles a inteligencia.

low y medium ahora rinden

Son más fuertes en Opus 5 que en Opus previos. Úsalos con generosidad como control principal de coste y latencia donde tus evals muestren que la calidad se mantiene.

Rehaz tu barrido de effort

Si arrastras la configuración de un modelo anterior, no la reutilices: haz un barrido nuevo sobre tus propias evals.

Effort ≠ longitud de respuesta

Controla el volumen de thinking, no lo que se ve. Bajar effort no acorta de forma fiable la respuesta visible: pide brevedad en el prompt.

Sube max_tokens

Con xhigh o max, deja margen para pensar y actuar entre subagentes y tool calls. 64k es un punto de partida razonable.

Mantén el effort constante

Cambiar de nivel entre peticiones invalida los prefijos cacheados. Elige uno al inicio de la sesión y no lo muevas.

Guía de prompting

Lo que hay que quitar
de tus prompts actuales.

Opus 5 funciona bien de fábrica con los prompts de Opus 4.8. Pero hay andamiaje heredado que ahora resta: instrucciones que se suman al comportamiento propio del modelo y queman tokens sin ganar calidad.

Quitar

Andamiaje que ahora sobra

  • «Incluye un paso final de verificación para cualquier tarea no trivial» — provoca sobre-verificación.
  • «Usa un subagente para verificar» — el modelo ya verifica solo; delegar a verificar multiplica coste.
  • «Comprueba tu respuesta dos veces» / «revierifica antes de responder» — se compone con su propio comportamiento.
  • «Reporta solo problemas de severidad alta» / «sé conservador» en revisión de código — lo cumple literalmente y reporta menos.
  • Reglas que le prohíben pensar o razonar — aumentan la fuga de etiquetas XML internas.
  • Workarounds de visión afinados para modelos previos — revalídalos, puede que ya no hagan falta.
Añadir

Controles nuevos que sí valen

  • Brevedad explícita. Las respuestas por defecto son más largas; pídelo en el prompt, no bajando effort.
  • Cadencia de narración. Describe cómo quieres los avances durante trabajo agéntico; los ejemplos positivos funcionan mejor que las prohibiciones.
  • Calibración de longitud de documentos. Los ficheros que escribe a disco tienden a ser largos.
  • Límites de alcance. Puede ampliar la tarea por su cuenta; acota qué se entrega y qué no.
  • Topes de delegación. Define qué escenarios justifican subagentes, o pon un tope determinista.
  • Umbral de correcciones. Que solo corrija lo que cambie el código, las conclusiones o las decisiones del usuario.
01

Concisión en producto conversacional

Keep responses focused, brief, and concise. Keep
disclaimers and caveats short, and spend most of the
response on the main answer. When asked to explain
something, give a high-level summary unless an in-depth
explanation is specifically requested.
02

Cadencia de avances al usuario

Before your first tool call, say in one sentence what
you're about to do. While working, give a brief update
only when you find something important or change
direction. When you finish, lead with the outcome.
03

Tope de subagentes

Delegate to a subagent only for large tasks that are
genuinely independent and parallelizable. Do not delegate
work you can finish yourself in a handful of tool calls,
and do not use subagents to verify your own work. Keep
spawn counts low.
04

Control de alcance

Deliver what was asked, at the scope intended. Make
routine judgment calls yourself, and check in only when
different readings would lead to materially different
work. Finish the whole task, and stop short of actions
clearly beyond what was asked.
Migración

De Opus 4.8 a Opus 5
en tres pasos.

  1. 01

    Cambia el ID de modelo

    // TypeScript
    let model = "claude-opus-4-8"; // antes
    model = "claude-opus-5";      // después
  2. 02

    Revisa max_tokens

    Thinking está activado por defecto y max_tokens es un límite duro sobre la salida total: thinking más texto de respuesta. Si tu carga corría sin thinking en Opus 4.8, súbelo.

  3. 03

    Comprueba el breaking change de thinking

    Si desactivas thinking, o bajas el effort a high o inferior, o quitas el campo thinking y te quedas con el effort alto. Las dos opciones son válidas; mezclarlas no.

     effort: "max"   + thinking: "disabled"  → 400
     effort: "high"  + thinking: "disabled"  → ok
     effort: "max"   (sin campo thinking)     → ok
Primera llamada · effort max con streaming
client = anthropic.Anthropic()

with client.messages.stream(
    model="claude-opus-5",
    max_tokens=64000,
    output_config={"effort": "max"},
    messages=[
        {
            "role": "user",
            "content": "Explain why the sum of two even numbers is always even.",
        }
    ],
) as stream:
    response = stream.get_final_message()

print(response)

No hace falta el campo thinking: está activado por defecto. Con 64k de max_tokens la petición puede pasarse del límite de tiempo sin streaming — usa stream.

Alineamiento

El modelo más alineado
de Anthropic hasta la fecha.

Según su auditoría automatizada de comportamiento, con la puntuación de comportamiento desalineado más baja de los modelos recientes.

2,3

Comportamiento desalineado, puntuación global

La más baja de los modelos recientes en la auditoría automatizada de comportamiento. Menor es mejor.

Ciberseguridad

Clasificadores un 85% menos restrictivos que los de Fable 5. Permiten búsqueda de vulnerabilidades; bloquean escaneo de binarios, pruebas de penetración y generación de exploits. El Cyber Verification Program habilita el trabajo restringido a empresas e investigadores verificados.

Biología

El modelo generalmente disponible más capaz para investigación, con limitaciones demostradas en tareas autónomas de larga duración. Las peticiones bloqueadas ahora se enrutan a Opus 5 en lugar de a Opus 4.8.

Frontera de doble uso

No avanza la frontera en capacidades de doble uso de riesgo. Queda por detrás de Mythos 5 tanto en investigación en biología como en ciberseguridad ofensiva. Salvaguardas equivalentes a las de Opus 4.8 más guardarraíles de ciber reforzados.

Early access

Lo que reportan
los primeros equipos.

Resumen de las valoraciones publicadas en el anuncio de lanzamiento.

Se aproxima al rendimiento de Fable 5 a la mitad del coste, con una fuerza particular en depuración.

DevinCEO

Inteligencia cercana a la de Fable 5, con la velocidad y el coste de Opus.

CursorCo-fundador

Lideró AutomationBench sin gasto excesivo de tokens, alcanzando el 100% de aprobación.

ZapierCEO

22% de mejora en las tareas agénticas más difíciles, con mucha menos varianza entre ejecuciones.

LovableCo-fundador

El salto más claro en resolución de problemas de un modelo de Claude al siguiente.

JetBrainsHead of AI
Disponible hoy

Cambia una línea.
Empieza a construir.

Disponible para todos los clientes en la Claude API, Amazon Bedrock, Google Cloud y Microsoft Foundry. Modelo por defecto en Claude Max y el más potente en Claude Pro. Sin requisitos de retención de datos.

  • Claude APIclaude-opus-5
  • Amazon Bedrockanthropic.claude-opus-5
  • Google Cloudclaude-opus-5
  • Microsoft FoundryClaude Opus 5