¿Por qué Claude Opus 5.5 parece tan bestia? Lo importante no es una IA “más lista”, sino una IA que termina el trabajo

Tras el lanzamiento aparecieron relatos de usuarios que ejecutaban High durante horas y apenas consumían su cuota, o que mantenían varias tareas creativas y de…

Cómo usar las herramientas de lectura

Escuchar lee el artículo en voz alta. La lectura rápida muestra frases a tu ritmo. La práctica de idiomas compara las traducciones disponibles. Guardar añade un marcador en este navegador, accesible desde los guardados del reproductor.

Compartir este artículo

Compartir este artículo

Publicidad
Publicidad

Resumen en cinco segundos: El salto de Claude Opus 5.5 no consiste solo en responder mejor preguntas aisladas. Lo importante es que puede sostener tareas largas de programación, repositorios enormes, muchas llamadas a herramientas, verificación propia y flujos de varios pasos con menos vueltas y menos tokens que Opus 5. Además, el precio de la API bajó. La competición empieza a parecer menos un examen de CI y más una prueba de “¿quién llega hasta el final?”. [1]

1. Las redes gritaron “Opus está roto”, pero la barra de uso no es la historia principal

Tras el lanzamiento aparecieron relatos de usuarios que ejecutaban High durante horas y apenas consumían su cuota, o que mantenían varias tareas creativas y de programación en paralelo.

Son anécdotas interesantes, pero una barra de uso no es un benchmark. El plan, la caché, el nivel de esfuerzo, el tipo de tarea y los reinicios de cuota cambian por completo lo que significa “solo gasté un 8%”.

Lo relevante es que esta vez hay cifras oficiales de eficiencia. Anthropic afirma que Opus 5.5 cuesta alrededor de un 40% menos que Opus 5 en cargas típicas, genera salida más de un 30% más rápido y cuesta 4 dólares por millón de tokens de entrada, 20 dólares por millón de salida y 0,20 dólares por millón de lecturas de caché. En Opus 5 eran 5, 25 y 0,50 dólares. [1]

No se trata de ahorrar escribiendo respuestas más cortas. Se trata de desperdiciar menos pasos entre recibir el encargo y terminarlo.

2. De 5 a 5.5 mejoró tanto la inteligencia como la forma de trabajar

Los ejemplos son llamativos.

Anthropic cuenta que un usuario temprano terminó una migración de unas 680.000 líneas de código en menos de un día. En otra auditoría de unas 200.000 líneas, Opus 5.5 terminó en menos de tres horas; Opus 5 tardó más de veinte y utilizó unas 2,5 veces más tokens. [1]

En una prueba de optimización web, Opus 5.5 mejoró los tiempos de carga en 39 de 40 intentos. Equipos de GitHub, Lovable y Kiro también describieron menos reintentos, ediciones más completas después de recopilar contexto y menos llamadas a herramientas para resolver una tarea. [1]

El fallo clásico del agente es:

  1. investigar;
  2. arreglar la mitad;
  3. descubrir otro problema;
  4. anunciar orgullosamente que lo ha descubierto;
  5. esperar a que el humano diga: “Perfecto. Ahora arréglalo.”

La evolución importante es reducir este “servicio de entrega de resultados intermedios” y enlazar investigar→cambiar→probar→corregir→verificar finalización.

3. ¿Explora mejor que GPT-6 Astra? Depende de qué llames exploración

Reducir “exploración” a un único número es engañoso.

En la tabla de Anthropic, Opus 5.5 obtiene 66,4% en Terminal-Bench 4.0 frente a 57,9% de Astra. En FrontierCode Main: 54,4% frente a 53,3%. En GDPval-AA de trabajo de conocimiento: 1846 frente a 1542. [1]

Pero en Terminal-Bench Science 0.1 gana Astra: 64,6% frente a 58,7%. También queda ligeramente por encima en AutomationBench: 41,4% frente a 40,0%. [1]

OpenAI informa además de un 99,9% para Astra en ARC-AGI-3, una prueba centrada en adaptación a entornos novedosos. [2]

A grandes rasgos:

Tipo de exploración Tendencia
Leer un repo enorme, aislar causas y seguir corrigiendo Opus 5.5 muy fuerte
Editar varios archivos, probar y volver a corregir Opus 5.5 muy fuerte
Mantener un objetivo durante sesiones largas Gran mejora de Opus 5.5
Software científico, simulación, ajuste y flujos de investigación Astra puntúa mejor
Aprender las reglas de un entorno realmente nuevo Astra es excepcional
Navegador, ordenador y varias apps Depende mucho del harness

Así que ni “Astra está muerto” ni “Opus gana todo”.

Explorar no es solo tener una idea brillante. También es crear ramas, probarlas, descartar fracasos, conservar contexto y seguir avanzando. Por eso la eficiencia de tokens y el uso de herramientas forman parte de la inteligencia práctica.

4. GPT-6 Sol también se abarató: las horas extra de la IA cuestan menos

OpenAI compite en el mismo terreno económico.

La página oficial de GPT-6 Sol lista 2 dólares por millón de tokens de entrada, 10 por millón de salida y 0,20 por millón de entrada en caché. También anuncia 1,05 millones de tokens de contexto y hasta 128.000 tokens de salida, orientado a programación compleja y agentes. [3]

La pregunta competitiva cambia.

Ya no es solo:

“¿Qué modelo es el más inteligente?”

Ahora también es:

“¿Qué modelo puede hacer cien llamadas a herramientas, trabajar durante horas y no matar antes el presupuesto o el límite?”

Inferencia más barata significa más ramas de exploración, más rondas de verificación y más subagentes.

Bajar el precio de la inteligencia también baja el precio del ensayo y error.

5. ¿Cuánto cuestan los planes de Claude? Desde 20 dólares, pero no significa “todo ilimitado”

Anthropic lista Free a 0 dólares, Pro a 20 dólares al mes o 200 al año, Max 5x a 100 dólares al mes y Max 20x a 200 dólares al mes. Max ofrece aproximadamente cinco o veinte veces la capacidad de sesión de Pro e incluye Claude Code. [4][5][6]

Lo importante es no tratar la suscripción, Claude Code interactivo, la API y la ejecución no interactiva como si fueran la misma cartera.

Pagar Pro o Max no vuelve ilimitada la API de Anthropic. El uso normal mediante API key sigue siendo por consumo; Opus 5.5 parte de 4 dólares de entrada y 20 de salida por millón de tokens. [1][4]

Claude Code interactivo consume la cuota incluida en el plan.

Desde el 15 de junio de 2026, para usuarios elegibles de Pro, Max, Team y Enterprise, Agent SDK y el modo no interactivo claude -p de Claude Code dejaron de contar contra los límites normales del plan. Además, pueden reclamar un crédito mensual separado para Agent SDK: 20 dólares en Pro, 100 en Max 5x y 200 en Max 20x. Las cuentas de Claude Platform de pago por uso con API key no reciben ese crédito. [7]

La conclusión no es “pago una suscripción y todo es infinito”, sino que separar trabajo interactivo de automatización puede cambiar mucho la economía. Las tarifas de IA ya empiezan a parecer planes de telefonía con letra pequeña.

6. ¿Se puede meter Opus 5.5 en OpenCode? Por API sí; reutilizar la suscripción es otro asunto

OpenCode admite muchos proveedores, así que usar una clave de la API de Anthropic con modelos Claude es una arquitectura normal. [8]

La idea tentadora es: “Si ya pago Pro o Max, ¿puedo dejar que OpenCode consuma esa tarifa plana?”

La documentación actual de OpenCode dice que existen plugins para usar modelos Pro/Max desde OpenCode, pero que Anthropic prohíbe explícitamente ese uso y que esos plugins dejaron de venir incluidos desde OpenCode 1.3.0. [8]

Las rutas limpias son:

  • OpenCode + API de Anthropic: flexible, pero medido.
  • Claude Code + Pro/Max: ruta soportada por Anthropic; el uso interactivo consume la cuota.

También tiene sentido repartir papeles: GPT-6 Sol para ejecución barata y masiva, Opus 5.5 para trabajos largos de repositorio y Astra para exploración científica o entornos desconocidos especialmente difíciles.

La IA ya tiene especialización laboral. Por suerte todavía no convoca reuniones de estado.

7. El cambio tectónico real es que cambia la forma de delegar

Los modelos punteros anteriores podían ser asesores brillantes y trabajadores desesperantes.

A menudo terminaban así:

“He investigado el problema.”
“He encontrado la causa.”
“El siguiente paso sería…”

Y el humano tenía que responder: “Sí. Hazlo.”

Lo interesante de Opus 5.5 son los ejemplos de continuidad. Un usuario temprano informó de más de 18 horas de trabajo sin supervisión a través de seis repositorios, además de migraciones gigantes, auditorías y bucles de autoverificación más fáciles de montar. [1]

Si ese comportamiento se generaliza, los prompts cambian de:

“Arregla esta función.”

a:

“Consigue este resultado. Investiga la causa, haz los cambios necesarios, ejecuta pruebas, repara los fallos y sigue hasta cumplir los criterios de finalización.”

Y la evaluación práctica también cambia: porcentaje de finalización, número de intervenciones humanas, tokens totales, llamadas a herramientas, tiempo real y capacidad de recuperarse de errores.

Puede que nunca exista un único “mejor modelo”.

Pero Opus 5.5 representa bien esta nueva fase: la competición de agentes empieza a mirar tanto el historial de trabajo terminado como el examen de aptitud.

8. ¿Y cuánto baja realmente la cuota? Astra ya parece pesado en la tabla oficial

Llegamos al deporte favorito de internet: mirar cómo se mueve la barra de uso.

La ayuda actual de OpenAI indica que Work y Codex comparten cuota y que, según el plan, pueden aplicar límites de cinco horas y semanales. Los mensajes locales estimados por cada cinco horas para GPT-6 Astra son 5–45 en Plus, 25–225 en Pro 5x y 100–900 en Pro 20x. Para GPT-5.6 Sol son 10–100, 50–500 y 200–2.000. [9]

No son límites fijos de mensajes. El consumo real cambia con la tarea, el razonamiento y el contexto. Pero incluso la tabla oficial presenta a Astra como un modelo que permite menos solicitudes con la misma cuota incluida.

Las mediciones comunitarias apuntan en la misma dirección. Un usuario registró durante veinte días planes económicos de Claude y Codex y estimó que Claude ofrecía aproximadamente entre tres y cinco veces más presupuesto semanal efectivo equivalente a API, según el modelo. [10] Otro usuario veterano de Codex afirmó haber agotado la cuota semanal de un plan de 200 dólares tras unas veinte horas de programación con Astra High. [11]

En Hacker News, un usuario dijo consumir alrededor del 70% de la cuota semanal de un plan Astra de 100 dólares en unas cinco horas; otro informó de solo un 5% semanal tras ocho horas de trabajo algorítmico profundo con Opus 5.5. [12]

Eso no significa “Claude siempre es catorce veces más barato”. No son experimentos controlados: cambian carga, effort, caché, subagentes y momento del reset. Además, Anthropic aumentó los límites de cinco horas al lanzar Opus 5.5. [1]

La lectura prudente es:

Astra es potente, pero pesado en cuota. Opus 5.5 parece competitivo no solo en capacidad, sino en cuántas horas de trabajo serio caben dentro de una semana.

La comparación de IA pasó de caballos de potencia a consumo por kilómetro.

9. Claude Code empieza en 20 dólares al mes; no hace falta saltar directamente a 100

La entrada por suscripción a Claude Code es Pro: 20 dólares al mes, o 200 al año, equivalente a unos 17 al mes. Max 5x cuesta 100 dólares al mes y Max 20x, 200. [6][5]

Así que para probar Claude Code el mínimo es 20 dólares.

Max compra principalmente capacidad. Max 5x ofrece aproximadamente cinco veces la capacidad de Pro y Max 20x unas veinte veces. [5]

Para comparar conviene usar el mismo repositorio y tareas similares, y registrar:

  • cuándo importa realmente el límite de cinco horas;
  • qué porcentaje semanal se consume;
  • cuántas intervenciones humanas hacen falta;
  • si se completan los tests;
  • cuántos cambios innecesarios aparecen.

Un plan superior se parece menos a “comprar un cerebro más inteligente” y más a darle un turno más largo a un trabajador que ya demostró ser útil.

10. ¿Qué se migra de Codex a Claude Code? No el “cerebro”: Git y el documento de traspaso

Al cambiar de agente de programación, parece lógico importar meses de chats y hacer que el nuevo modelo los “aprenda”.

En la práctica, suele funcionar mejor comprimir las decisiones vigentes en archivos del repositorio.

Claude Code lee automáticamente un CLAUDE.md en la raíz del repo al comienzo de cada sesión. Anthropic recomienda incluir comandos de build y test, estructura de directorios, convenciones y restricciones duraderas, y sugiere mantenerlo aproximadamente por debajo de 200 líneas. [13]

Una estructura práctica:

  • repositorio Git: fuente de verdad para código e historial;
  • AGENTS.md: referencia de reglas del agente anterior;
  • CLAUDE.md: reglas estables que Claude lee en cada sesión;
  • docs/AI-HANDOFF.md: estado actual, problemas abiertos y decisiones recientes;
  • historial Git: evidencia de por qué el sistema tiene su forma actual.

Claude Code también puede generar un borrador de CLAUDE.md con /init. [13]

No conviertas CLAUDE.md en “todo-el-conocimiento-humano.txt”. Como se carga continuamente, demasiada información diluye lo importante. Tampoco pongas secretos, tokens, credenciales ni cadenas de conexión. [13]

Migrar no es reentrenar.

No copias el cerebro de un modelo; colocas la constitución del proyecto y las notas de traspaso en Git.

11. El primer prompt debería decir “reconstruye el mundo desde el repo” antes de “empieza a modificar”

En la primera sesión, recuperar contexto antes de editar reduce rediseños accidentales.

Ejemplo de prompt de traspaso

Hazte cargo de este repositorio mantenido hasta ahora por otro coding agent.
Antes de cambiar código, revisa todo el repo, README, AGENTS.md, docs,
package scripts, configuración CI/deploy e historial Git.
Identifica fuentes de verdad, rutas build/test/deploy, criterios de finalización,
acciones prohibidas y problemas sin resolver.
Pon las reglas estables en CLAUDE.md y la información cambiante del estado actual
en docs/AI-HANDOFF.md.
No muestres, guardes ni hagas commit de secretos, tokens o credenciales.
Antes de preguntarme, busca primero evidencia en el repo y su historial.
No declares terminado un trabajo mientras queden tests o verificaciones
de producción alcanzables.

Así la persona no necesita narrar otra vez toda la biografía del proyecto.

Y al comprimir solo las decisiones aún vigentes, el contexto queda más limpio que al volcar meses de chats.

La incorporación de empleados de IA también termina dependiendo de buena documentación.

12. ¿Cuál es la función que sigue trabajando con el portátil cerrado? Ejecución en la nube, no magia de logout

Separando conceptos es sencillo.

Claude Code on the web clona un repositorio GitHub en un entorno remoto administrado por Anthropic y trabaja en una máquina virtual aislada. Una vez iniciada la tarea, puedes abandonar la página y seguirá ejecutándose. Al terminar, puede subir cambios a una rama y preparar un PR para revisión. [14]

Claude Code Desktop incluye “Continue with Claude Code on the web”, que mueve una sesión local al cloud para continuarla desde web o móvil. [15]

Para tareas periódicas hay dos caminos:

  • /loop: repetición local, pensada para trabajos locales de hasta unos tres días; depende de la máquina.
  • /schedule: Cloud Jobs; sigue trabajando aunque cierres el portátil. [16]

Routines permite empaquetar prompt, repo y conectores en una automatización que se ejecuta en la infraestructura web de Claude Code por horario, llamada API o evento. [17]

El truco, por tanto, no es mantener vivo un proceso local a base de voluntad. Es mover el trabajo al cloud.

Cerrar el navegador ya no significa que la IA fiche la salida. El humano puede irse primero.

Si la tarea necesita archivos que solo existen en el PC local o control directo de esa máquina, es otro caso: lo que el cloud no puede ver no aparece por telepatía.

En 2026 ya no basta con preguntar “¿qué modelo es el más inteligente?”

Hay que pensar en capacidad × tasa de finalización × consumo semanal × facilidad de traspaso × ejecución en cloud.

Ese producto explica por qué Opus 5.5 con Claude Code se ve de repente mucho más fuerte que lo que sugiere una sola tabla de benchmarks.


  1. Anthropic — “Introducing Claude Opus 5.5” (2026-09-22) Used for release claims, pricing, speed, Opus 5 comparisons, benchmark table, long-running coding examples, early-tester reports, and efficiency claims anthropic.com
  2. OpenAI — “GPT-6 Astra: A new generation of intelligence” Used for Astra benchmark results, ARC-AGI-3, Terminal-Bench Science, coding comparisons, and positioning around novel-environment adaptation openai.com
  3. OpenAI Developers — GPT-6 Sol model page Used for GPT-6 Sol model positioning, context/output limits, and advertised token pricing developers.openai.com
  4. Anthropic Help Center — “Choose a Claude plan” Used for Free, Pro, Max 5x, and Max 20x consumer pricing support.claude.com
  5. Anthropic Help Center — “What is the Max plan?” Used for Max usage multipliers and Claude Code access support.claude.com
  6. Anthropic Help Center — “What is the Pro plan?” Used for Pro pricing and Claude Code inclusion support.claude.com
  7. Anthropic Help Center — “Use the Claude Agent SDK with your Claude plan” Used for the June 15, 2026 separation of Agent SDK / claude -p usage from normal interactive plan limits, and the separate monthly credits for eligible Pro, Max, Team, and Enterprise users support.claude.com
  8. OpenCode — “Providers” Used for Anthropic provider setup and OpenCode’s current warning that using Claude Pro/Max through OpenCode is explicitly prohibited by Anthropic and that such plugins stopped being bundled from OpenCode 1.3.0 opencode.ai
  9. OpenAI Help Center — “Managing usage with GPT-6 Astra in Work and Codex” Used for shared Work/Codex allowance mechanics, five-hour and weekly-limit caveats, and estimated local messages per five-hour period for Astra, Sol, and other models help.openai.com
  10. Reddit r/codex — “Measured Claude usage limits are 3–5× those of Codex” (2026-09-18) Community measurement based on roughly twenty days of usage logging. Treated as anecdotal observational evidence, not a controlled benchmark reddit.com
  11. Reddit r/codex — “Codex is in a really bad spot right now…” (2026-09-23) Used only for community reports about heavy Astra weekly-quota consumption and Opus 5.5 usage experience. Not treated as vendor-independent benchmark proof reddit.com
  12. Hacker News — “Claude Opus 5.5” discussion (2026-09-23/24) Used for contrasting real-user usage anecdotes, including heavy Astra quota consumption and low Opus 5.5 weekly consumption in long algorithmic work. These reports are uncontrolled news.ycombinator.com
  13. Anthropic Help Center — “Give Claude context: CLAUDE.md and better prompts” Used for CLAUDE.md automatic loading, /init, recommended content, and keeping project instructions concise support.claude.com
  14. Anthropic Help Center — “Claude Code on the web” Used for remote GitHub execution, isolated environments, leaving the page while work continues, and branch/PR workflows support.claude.com
  15. Anthropic — “Preview, review, and merge with Claude Code” (2026-02-20) Used for “Continue with Claude Code on the web” and moving a desktop session into the cloud claude.com
  16. Anthropic Help Center — “Claude Code power user tips” Used for /loop as local recurring execution and /schedule as Cloud Jobs that continue when the laptop is closed support.claude.com
  17. Anthropic — “Introducing routines in Claude Code” (2026-04-14) Used for cloud routines triggered by schedules, API calls, or events claude.com

Compartir este artículo

Publicidad

Buscar otros artículos

Todos los artículos

Mendoi-chan

Escrito por

Mendoi-chan

Convierte las fricciones del trabajo y la vida diaria en estructuras claras y próximos pasos prácticos.

Acerca del sitio
Publicidad

Artículos recientes

  1. 1Cuando Zero se retiró, los Caballeros Negros también deberían haberse retirado|Todo y el límite de una organización demasiado dependiente de Zero
  2. 2El infierno de quienes tuvieron que esperar desde el episodio 25 de la primera temporada hasta R2|Del final a punta de pistola al arranque con recuerdos alterados
  3. 3Una luna azul no es una Luna de color azul
  4. 4Cuando la belleza deja de controlar la decisión: perder la urgencia romántica y priorizar la compatibilidad y el diseño de vida
  5. 5Una buena consulta debe aumentar la información, no solo la certeza

También te puede interesar

Publicidad