Los dos modelos punteros empataron en la prueba, y eso confirma que la prueba ya no decide
Qué pasóEl hecho
El 5 de febrero de 2026, Anthropic lanzó Claude Opus 4.6, con ventana de contexto de un millón de tokens en fase beta, pensamiento extendido adaptativo, compactación de contexto y capacidades multimodales —texto, imágenes y PDF— en un mismo modelo.
En capacidades de trabajo autónomo, la novedad es la gestión de equipos de agentes trabajando en conjunto, además de mejoras en planificación, revisión de código y detección de errores propios.
Y las cifras de evaluación: lidera Terminal-Bench 2.0 —codificación agéntica— y alcanza alrededor de 79.6% en SWE-Bench, empatando con GPT-5.3.
Qué opinan los mediosCómo lo encuadró cada quien
El único que enmarca el lanzamiento por su función y no por su ficha técnica: un modelo para la etapa agéntica de la IA. Ver nota
El anuncio oficial, y el origen de los puntajes que reproduce toda la cobertura. Ver anuncio
Análisis con pruebas comparativas frente a modelos rivales. Ver análisis
Centrado en la ventana de un millón de tokens como titular. Ver nota
Panorama completo del modelo desde el lado de quien lo integra en producto. Ver análisis
Enfoque para desarrolladores, con el detalle de las mejoras de codificación. Ver análisis
Indicadores de coberturaCómo se distribuyó la narrativa
Cuatro son publicaciones técnicas o de formación, no medios generalistas.
El formato dominante es la ficha técnica.
Los puntajes proceden del fabricante. Ninguna fuente revisada los replicó de forma independiente.
Una fuente latinoamericana, ninguna mexicana.
Cuatro de seis fuentes listaron características. La cifra con consecuencias es la que suena a anticlímax: 79.6% en SWE-Bench, empatando con el modelo puntero del competidor.
En noviembre de 2025, cuando Google publicó los puntajes de Gemini 3, escribimos aquí que «la capacidad se empata entre competidores en meses; la distribución no». El empate llegó en tres.
La consecuencia para quien compra es directa: si los modelos punteros rinden lo mismo en las pruebas que ellos mismos eligen, el puntaje deja de servir como criterio de decisión. Lo que queda para decidir es aburrido y verificable: precio por uso, límites de la ventana de contexto, condiciones de datos, disponibilidad regional y dónde está instalado el modelo.
Dónde impactaQué significa esto en la operación
A quien esté eligiendo proveedor de modelo para un producto o un proceso interno.
Software, agencias con desarrollo propio, equipos de datos, servicios profesionales.
Inmediato para decisiones de arquitectura; la ventana de un millón de tokens está en beta.
Sustituir la comparación de puntajes por una prueba con tus propios casos. Con los modelos empatados en el promedio, la diferencia aparece en tu tarea concreta, no en la tabla.
Hay un detalle que merece crédito y que no cambia la lectura anterior: Anthropic publicó una System Card del modelo. Es exactamente el tipo de documento que la ley californiana de transparencia empezó a exigir el 1 de enero. Que exista permite comparar proveedores con algo más que puntajes, y ese material no estaba disponible hace un año.
Esperamos que aparezcan pruebas nuevas donde cada fabricante vuelva a poder liderar, y que el ciclo se repita: se satura una prueba, se inventa otra. Ya está ocurriendo con las evaluaciones de trabajo agéntico, que son las más difíciles de auditar desde fuera.
Vigilaremos si algún tercero independiente publica evaluaciones comparables entre modelos. Es lo que le faltó a esta industria durante todo 2025 y sigue faltando.
Fuentes
- Anthropic — Claude Opus 4.6
- DPL News — Anthropic lanza nueva versión de Claude Opus para la etapa agéntica
- DataCamp — Claude Opus 4.6: características y pruebas comparativas
- DonWeb — Claude Opus 4.6: ventajas, capacidades y 1M tokens
- eesel AI — Panorama completo del modelo
- Cursos Desarrollo Web — Análisis del nuevo modelo de Anthropic
Las noticias son abundantes. El criterio es escaso.
Cada mediodía filtramos el ruido para que solo leas las historias que pueden cambiar una decisión de negocio.
Pensado para directores de marketing, fundadores y equipos de crecimiento.