IA 360
Actualidad

Anthropic lanza Claude 3: Opus supera a GPT-4 en varios tests

Anthropic presenta Claude 3, una familia de tres modelos con visión y una ventana de contexto de 200.000 tokens. Su modelo Opus lidera varios benchmarks frente a GPT-4, aunque esas pruebas no bastan para medir su utilidad real.

5 min de lectura Generado con IA Read in English
Anthropic lanza Claude 3: Opus supera a GPT-4 en varios tests

El 4 de marzo de 2024, Anthropic presentó Claude 3 como una familia de tres modelos —Haiku, Sonnet y Opus— con visión y distintos compromisos entre capacidad, velocidad y coste. El anuncio de Anthropic contiene la tabla de resultados que sitúa a Opus por delante de varios rivales; es evidencia publicada por el fabricante, no un veredicto independiente.

El anuncio importa porque devuelve a Anthropic a la primera línea de la carrera por los grandes modelos generativos. OpenAI había marcado la referencia comercial con GPT-4 durante el último año; ahora Anthropic propone una alternativa con capacidades comparables, lectura de imágenes y una oferta escalonada para distintos costes y velocidades.

Tres modelos para tareas y presupuestos distintos

Claude 3 no es un único modelo. Anthropic ha dividido la gama en tres niveles:

  • Claude 3 Opus es el modelo orientado a tareas complejas: análisis, investigación, programación y trabajos que requieren mantener muchos datos en contexto.
  • Claude 3 Sonnet busca un equilibrio entre capacidad, coste y rapidez. Desde hoy es el modelo que impulsa la versión gratuita de Claude.ai.
  • Claude 3 Haiku está diseñado para respuestas muy rápidas y baratas, útiles para atención al cliente, clasificación de documentos o extracción de información a gran escala. Anthropic prevé ponerlo a disposición próximamente.

Los tres admiten hasta 200.000 tokens de contexto, una medida de la cantidad de texto que pueden procesar en una conversación o documento. En términos prácticos, permite trabajar con cientos de páginas, aunque el límite no garantiza por sí mismo que el modelo encuentre siempre el detalle relevante ni que razone correctamente sobre él.

Opus y Sonnet ya están disponibles mediante la web Claude.ai y la API de Anthropic. Opus requiere la suscripción Claude Pro, que cuesta 20 dólares al mes en Estados Unidos. Para desarrolladores, Anthropic fija el precio de Opus en 15 dólares por cada millón de tokens de entrada y 75 dólares por cada millón de tokens generados; Sonnet cuesta 3 y 15 dólares, respectivamente. Haiku rebajará esa tarifa a 0,25 y 1,25 dólares.

Visión: Claude ya puede interpretar imágenes y documentos

La novedad funcional más clara es que Claude 3 se convierte en multimodal: puede analizar tanto texto como imágenes. El sistema puede interpretar fotografías, gráficos, diagramas y documentos escaneados, incluidas páginas con tablas o elementos visuales.

Esta capacidad acerca a Claude a GPT-4 con visión y a Gemini. No se trata simplemente de describir una imagen: el objetivo es poder preguntar por un gráfico financiero, revisar un formulario escaneado o extraer información de una diapositiva. Para empresas que manejan documentación poco estructurada, ese salto puede ser más relevante que una mejora marginal en un test académico.

Anthropic también afirma que Claude 3 responde con menos rechazos innecesarios que sus modelos anteriores. Es una cuestión relevante en asistentes empresariales: un sistema demasiado prudente puede negarse a ayudar con peticiones legítimas, mientras que uno demasiado permisivo puede dar instrucciones indebidas o inventar información. Encontrar ese equilibrio sigue siendo uno de los problemas centrales del sector.

Los benchmarks sitúan a Opus por delante, con matices

En sus evaluaciones, Anthropic sitúa a Claude 3 Opus por encima de GPT-4 y Gemini Ultra en pruebas como MMLU, que mide conocimientos en decenas de materias; GPQA, centrada en preguntas científicas de nivel avanzado; GSM8K, de problemas matemáticos escolares; y HumanEval, de programación.

La compañía comunica, por ejemplo, un 86,8% en MMLU y un 84,9% en HumanEval para Opus. Son resultados destacados, pero conviene leerlos como una señal y no como un veredicto definitivo. Los benchmarks miden conjuntos cerrados de preguntas y pueden favorecer determinadas técnicas de entrenamiento. Además, un modelo que obtiene una nota alta en un examen puede seguir equivocándose al resumir un contrato, interpretar una instrucción ambigua o citar una fuente inexistente.

La comparación con GPT-4 tampoco es del todo estática. Los modelos comerciales cambian mediante actualizaciones, configuraciones de producto y herramientas externas. Para un usuario o una empresa, la diferencia relevante no será solo cuál gana una tabla de resultados, sino cuál ofrece mejor fiabilidad, latencia, precio, privacidad e integración con sus flujos de trabajo.

Una competición que ya no depende solo del modelo más grande

Con Claude 3, Anthropic adopta una estrategia similar a la de otros proveedores: reservar la máxima capacidad para tareas de alto valor y ofrecer modelos más ligeros para operaciones masivas. Esa segmentación importa porque ejecutar modelos grandes es caro. Una empresa no necesita Opus para etiquetar miles de correos, pero sí puede necesitarlo para revisar documentación técnica compleja o asistir a un analista.

Anthropic ha desplegado Opus bajo su estándar de seguridad AI Safety Level 2, un marco interno con controles para modelos que aún no presentan, según su evaluación, riesgos cualitativamente nuevos de alto impacto. La empresa mantiene que no ha detectado señales de que Claude 3 pueda ayudar de forma sustancial a actores sin formación a desarrollar armas químicas, biológicas, radiológicas o nucleares.

El lanzamiento eleva la presión sobre OpenAI, Google y el resto de laboratorios. La comparación real empezará ahora: cuando Claude 3 se enfrente a documentos imperfectos, instrucciones largas y usuarios que no formulan su petición como una pregunta de examen.

Una tabla no elige el modelo por ti

Cada benchmark define un universo pequeño: preguntas, forma de puntuar, ayudas y versión concreta. Un promedio mezcla conocimientos, razonamiento y código aunque una organización solo necesite una de esas tareas. Antes de aceptar el ranking hay que abrir el protocolo, distinguir evaluación de pocos intentos o selección del mejor y comprobar si los rivales usaron las mismas instrucciones.

La contaminación es otro límite. Si preguntas o soluciones aparecen en los datos de entrenamiento, un resultado puede medir recuerdo además de generalización. Las pruebas privadas y los casos posteriores al corte reducen ese riesgo, pero deben conservar un verificador. Para código, ejecutar pruebas es más sólido que juzgar estilo; para documentos, las citas permiten comprobar cada afirmación.

Familia significa compromiso

Haiku, Sonnet y Opus no forman una escalera donde el mayor sea siempre correcto. Una tarea masiva y verificable puede favorecer velocidad; una decisión costosa puede justificar capacidad y revisión adicional. Se prepara un conjunto propio, se fija un umbral y se mide calidad, latencia, precio y tasa de abstención. El modelo se elige por función, no por prestigio.

La visión necesita una batería separada: fotografías, gráficos, tablas, texto pequeño y documentos torcidos. “Multimodal” solo significa que acepta más de un tipo de entrada. No garantiza lectura precisa de cada celda ni razonamiento espacial. Pedir que cite región o transcriba el fragmento relevante permite localizar el error antes de usar la respuesta.

La capacidad transferible es convertir el ranking de un fabricante en una evaluación comparable: versión, protocolo, tarea propia, verificador, coste y fallos. Esa ficha seguirá siendo útil cuando cambien los líderes de la tabla, porque mide el trabajo que importa y no la carrera publicitaria.

La seguridad declarada se prueba con la misma disciplina. Una menor tasa de rechazos puede ser una mejora si recupera peticiones legítimas y un retroceso si abre conductas dañinas. Se construyen pares cercanos —una tarea permitida y otra prohibida— y se mide ayuda, rechazo y explicación. Un promedio único no captura ese límite.

En producción se conserva una ruta de escalado. Cuando el modelo no aporta evidencia suficiente, una persona revisa o el sistema se abstiene. La mejor puntuación de laboratorio no elimina la necesidad de registrar incidentes, comparar revisiones y retirar una versión que empeora el riesgo.

El informe final incluye ejemplos de error, no solo promedios. Un fallo repetible permite decidir controles o descartar un uso; una puntuación alta sin muestras no explica dónde revisar. Elegir un modelo es también elegir qué errores podrá detectar el proceso que lo rodea.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar