Inteligencia artificial Impacto: medio Origen: Estados Unidos Alcance: global

Los dos modelos punteros empataron en la prueba, y eso confirma que la prueba ya no decide

Ocurrió: 5 de febrero de 2026 Verificado en 6 fuentes Etiquetas: modelos, benchmarks, agentes, criterio de compra

Qué pasóEl hecho

El 5 de febrero de 2026, Anthropic lanzó Claude Opus 4.6, con ventana de contexto de un millón de tokens en fase beta, pensamiento extendido adaptativo, compactación de contexto y capacidades multimodales —texto, imágenes y PDF— en un mismo modelo.

En capacidades de trabajo autónomo, la novedad es la gestión de equipos de agentes trabajando en conjunto, además de mejoras en planificación, revisión de código y detección de errores propios.

Y las cifras de evaluación: lidera Terminal-Bench 2.0 —codificación agéntica— y alcanza alrededor de 79.6% en SWE-Bench, empatando con GPT-5.3.

Qué opinan los mediosCómo lo encuadró cada quien

Distribución del encuadre 6 fuentes revisadas
  • Repaso de características · 4 de 6
  • La etapa agéntica · 1 de 6
  • Fuente primaria · 1 de 6
DPL News Telecomunicaciones · LATAM
La etapa agéntica

El único que enmarca el lanzamiento por su función y no por su ficha técnica: un modelo para la etapa agéntica de la IA. Ver nota

Anthropic Fuente primaria · Estados Unidos
Fuente primaria

El anuncio oficial, y el origen de los puntajes que reproduce toda la cobertura. Ver anuncio

DataCamp Formación técnica · Internacional
Repaso de características

Análisis con pruebas comparativas frente a modelos rivales. Ver análisis

DonWeb Tecnología · Internacional
Repaso de características

Centrado en la ventana de un millón de tokens como titular. Ver nota

eesel AI Software · Internacional
Repaso de características

Panorama completo del modelo desde el lado de quien lo integra en producto. Ver análisis

Cursos Desarrollo Web Formación · España
Repaso de características

Enfoque para desarrolladores, con el detalle de las mejoras de codificación. Ver análisis

Indicadores de coberturaCómo se distribuyó la narrativa

Fuentes revisadas 6

Cuatro son publicaciones técnicas o de formación, no medios generalistas.

Consenso 4 de 6

El formato dominante es la ficha técnica.

Origen del dato 1 fuente

Los puntajes proceden del fabricante. Ninguna fuente revisada los replicó de forma independiente.

Cobertura local 0 de 6

Una fuente latinoamericana, ninguna mexicana.

El ángulo que faltó: un empate técnico es una noticia comercial

Cuatro de seis fuentes listaron características. La cifra con consecuencias es la que suena a anticlímax: 79.6% en SWE-Bench, empatando con el modelo puntero del competidor.

En noviembre de 2025, cuando Google publicó los puntajes de Gemini 3, escribimos aquí que «la capacidad se empata entre competidores en meses; la distribución no». El empate llegó en tres.

La consecuencia para quien compra es directa: si los modelos punteros rinden lo mismo en las pruebas que ellos mismos eligen, el puntaje deja de servir como criterio de decisión. Lo que queda para decidir es aburrido y verificable: precio por uso, límites de la ventana de contexto, condiciones de datos, disponibilidad regional y dónde está instalado el modelo.

Dónde impactaQué significa esto en la operación

A quién le pega

A quien esté eligiendo proveedor de modelo para un producto o un proceso interno.

Sectores

Software, agencias con desarrollo propio, equipos de datos, servicios profesionales.

Horizonte

Inmediato para decisiones de arquitectura; la ventana de un millón de tokens está en beta.

Qué hacer

Sustituir la comparación de puntajes por una prueba con tus propios casos. Con los modelos empatados en el promedio, la diferencia aparece en tu tarea concreta, no en la tabla.

Hay un detalle que merece crédito y que no cambia la lectura anterior: Anthropic publicó una System Card del modelo. Es exactamente el tipo de documento que la ley californiana de transparencia empezó a exigir el 1 de enero. Que exista permite comparar proveedores con algo más que puntajes, y ese material no estaba disponible hace un año.

Nuestra lectura

Esperamos que aparezcan pruebas nuevas donde cada fabricante vuelva a poder liderar, y que el ciclo se repita: se satura una prueba, se inventa otra. Ya está ocurriendo con las evaluaciones de trabajo agéntico, que son las más difíciles de auditar desde fuera.

Vigilaremos si algún tercero independiente publica evaluaciones comparables entre modelos. Es lo que le faltó a esta industria durante todo 2025 y sigue faltando.

Seguir subiendo
El mes Febrero de 2026 Qué definió el periodo y cómo se relacionan sus acontecimientos La categoría Inteligencia artificial Cómo evolucionó este tema desde mayo de 2025
MarkitalMarketing · IA · Negocios

Las noticias son abundantes. El criterio es escaso.

Cada mediodía filtramos el ruido para que solo leas las historias que pueden cambiar una decisión de negocio.

Pensado para directores de marketing, fundadores y equipos de crecimiento.