IA 360
Modelos de lenguaje

Los 450 millones de Anthropic financiaban seguridad, no la certificaban

La ronda de Anthropic financió Claude y su investigación, pero la seguridad exige amenazas, pruebas, controles y riesgo residual verificables.

4 min de lectura Generado con IA Read in English
Los 450 millones de Anthropic financiaban seguridad, no la certificaban

Anthropic anunció el 23 de mayo de 2023 una ronda Serie C de 450 millones de dólares para ampliar Claude, apoyar a empresas que lo desplegaran y continuar su investigación de seguridad. La financiación daba recursos a una promesa importante, pero no demostraba que el asistente fuera «seguro». La seguridad no es una identidad de marca: es un conjunto de amenazas, pruebas, controles y límites observables.

La distinción sirve más allá de Anthropic. Un laboratorio puede investigar alineamiento con seriedad y su producto puede fallar en un contexto concreto. Para evaluar la afirmación hay que preguntar: ¿seguro frente a qué daño, para quién, bajo qué acceso y comparado con qué alternativa?

Qué confirmó la ronda

El anuncio oficial identificó a Spark Capital como líder y a Google, Salesforce Ventures, Sound Ventures y Zoom Ventures entre los participantes. Anthropic dijo que emplearía el capital en productos de IA útiles, inofensivos y honestos, incluida Claude, y en técnicas para resistir conversaciones adversarias, seguir instrucciones precisas y explicar mejor comportamientos y límites.

El comunicado confirmaba importe, etapa, inversores declarados y destino previsto. No publicaba en esa página una auditoría, una tasa universal de fallos ni una garantía para clientes. Una inversión financia personal, cómputo y experimentos; el resultado de esos experimentos se comprueba por separado.

También conviene separar tres niveles. La seguridad de investigación pregunta cómo entrenar un comportamiento. La de producto añade acceso, datos, monitorización y respuesta a incidentes. La del uso depende del sector, usuario y consecuencia. Un asistente aceptable para idear un texto puede ser insuficiente para decidir una dosis o autorizar un pago.

Qué hacía la IA constitucional

El paper Constitutional AI: Harmlessness from AI Feedback describía dos fases. Primero, un modelo criticaba y revisaba sus respuestas usando principios escritos, y esas revisiones servían para afinado supervisado. Después, otro modelo comparaba respuestas según principios y generaba señales de preferencia para aprendizaje por refuerzo.

El método reemplazaba etiquetas humanas de inofensividad en ese experimento, no toda intervención humana. Personas escribieron principios, instrucciones y ejemplos; definieron la evaluación y aportaron datos de utilidad. La diferencia era dónde se escalaba la supervisión, no la desaparición de decisiones humanas.

El estudio informó de mejoras en evaluaciones de utilidad e inofensividad frente a modelos de comparación. También documentó límites. Las críticas podían ser inexactas o exageradas, entrenar demasiado producía respuestas excesivamente duras o formularias y los modelos de preferencia perdían calibración en valores extremos. El propio paper presentaba resultados de un protocolo, no una prueba de ausencia de daño.

Una constitución hace visibles unos valores

Anthropic publicó el 9 de mayo los principios utilizados con Claude y explicó que diferían de los del paper. Procedían de fuentes como la Declaración Universal de Derechos Humanos, prácticas de confianza y seguridad, reglas de otros laboratorios e intentos de incluir perspectivas no occidentales.

Hacer públicos los principios mejora la inspección: un lector puede discutir qué conducta se busca. Pero una regla escrita no demuestra que el modelo la aplicará correctamente a cada caso ni resuelve conflictos entre principios. Transparencia de intención, fidelidad de entrenamiento y conducta observada son tres pruebas distintas.

Una evaluación debe escoger conflictos reales: utilidad frente a privacidad, obediencia frente a prevención de daño, libertad de expresión frente a acoso. Se registra si el sistema reconoce la tensión, solicita contexto, se abstiene de la acción peligrosa y ofrece ayuda segura. Contar solo rechazos premia a un modelo que se niega a todo.

Más contexto amplía capacidad y superficie de fallo

Doce días antes de la ronda, Anthropic había ampliado la ventana de Claude de 9.000 a 100.000 tokens, unas 75.000 palabras según la empresa. Eso permitía enviar cientos de páginas y mantener conversaciones extensas. Era una capacidad de entrada, no una garantía de comprensión uniforme.

Un contexto largo permite analizar un contrato o varios informes sin trocearlos. También aumenta material que puede contradecirse, contener instrucciones maliciosas, datos personales o información irrelevante. El modelo puede recuperar bien un detalle en una demostración y fallar cuando cambia su posición, redacción o relación con otros fragmentos.

La prueba debe variar longitud y lugar de la evidencia. Incluye información al principio, medio y final; distractores parecidos; hechos incompatibles; una respuesta ausente que exige abstención; y texto que intenta cambiar las instrucciones. Se mide cita correcta, cobertura, contradicción, rechazo de instrucciones incrustadas y coste.

Convertir «seguro» en una matriz

Primero se define el activo: datos, dinero, reputación, bienestar o disponibilidad. Después, el actor: usuario legítimo, atacante externo, empleado con acceso o contenido de tercero. A continuación se describe el daño y el camino que lo produce. «Alucinación» es demasiado amplio; «atribuir una cláusula inexistente y enviarla a un cliente» sí puede probarse.

Cada amenaza recibe una barrera. Para fuga de datos: minimizar entrada, separar cuentas, permisos y retención. Para consejo incorrecto: fuentes, abstención, revisión experta y límites de uso. Para acciones: catálogo cerrado, autorización y confirmación. Para abuso deliberado: controles de acceso, cuotas, detección y respuesta.

La tabla termina con riesgo residual y propietario. Un filtro reduce probabilidad, no la hace cero. Alguien debe decidir si el resto es aceptable, observar señales y detener el sistema. Si nadie posee esa decisión, «seguridad» describe una aspiración sin operación.

Cómo comparar mecanismos de alineamiento

El conjunto de prueba se congela antes de mirar resultados e incluye peticiones normales y adversarias. Evaluadores ciegos puntúan utilidad, daño, evasividad, honestidad sobre límites y consistencia. Se publican criterios y distribución de fallos, no solo un promedio.

Después se realizan pruebas de desplazamiento: otros idiomas, ortografías, conversaciones largas, roles y dominios. Una constitución puede funcionar en ejemplos cercanos al entrenamiento y degradarse en situaciones nuevas. También se comprueba repetibilidad mediante múltiples muestras, porque una sola respuesta favorable no estima una tasa.

Por último, se evalúa el sistema completo. Un modelo alineado puede recibir documentos hostiles, conectarse a una herramienta demasiado poderosa o exponer registros. Red teaming del modelo, pruebas de integración, control de acceso y gestión de incidentes cubren capas diferentes. Ninguna sustituye a las demás.

El acceso cambia la conclusión

Una prueba de chat aislado no describe un modelo conectado a archivos, memoria o herramientas. Cada integración añade permisos y datos; por eso el informe debe declarar la configuración exacta. La misma respuesta puede ser inocua como texto y peligrosa si activa una operación.

También se separan capacidad y propensión. Que un modelo sepa producir contenido dañino no indica con qué frecuencia lo ofrecerá bajo controles; que lo rechace en una pregunta directa no prueba resistencia a reformulaciones. Ambas dimensiones exigen conjuntos y denominadores propios.

La severidad importa junto a la frecuencia. Mil negativas incómodas no compensan una fuga grave, y un fallo raro puede ser inaceptable si el acceso es amplio. Una tabla combina probabilidad, impacto, detectabilidad y reversibilidad. Así una mejora media no esconde la clase de error que decide el despliegue.

Lo que el capital podía y no podía comprar

Los 450 millones permitían entrenar modelos, contratar investigadores, ejecutar evaluaciones y sostener infraestructura. También daban margen para convertir resultados científicos en controles de producto. Eran condiciones para aprender y desplegar, no un certificado emitido por los inversores.

El lector puede exigir una cadena de evidencia: amenaza definida, principio relevante, método de entrenamiento, prueba con base de comparación, limitaciones, control de despliegue y responsable del riesgo residual. Cada eslabón responde una pregunta distinta y puede cambiar con la versión.

Anthropic colocó seguridad y fiabilidad en el centro de su ronda. La capacidad transferible es no aceptar ni descartar esa promesa por reputación: se traduce «seguro» en una matriz de activos, actores, daños, barreras y residuo, y se buscan resultados para cada celda. La inversión abre el trabajo; la evidencia determina lo que logró.

Este artículo se ha elaborado con inteligencia artificial bajo supervisión editorial humana.

Compartir este artículo

Artículos relacionados

Qué hace falta de verdad para entrenar tu propio modelo: la cuenta que nadie te enseña
Modelos de lenguaje

Qué hace falta de verdad para entrenar tu propio modelo: la cuenta que nadie te enseña

«Cuánta GPU hace falta» es la pregunta equivocada. Cómputo, datos y conocimiento no se suman: son tres puertas en serie, y la que casi nadie pasa no es la del hardware. Con el precio real de hoy, el corpus real de un modelo abierto y el cuaderno de bitácora real de un entrenamiento de 175.000 millones de parámetros, esta pieza hace la cuenta completa — y te dice en qué escalón estás tú.

7 min
Le pidieron a ChatGPT repetir 'poema' y recitó a Poe: qué prueba eso, y qué no
Modelos de lenguaje

Le pidieron a ChatGPT repetir 'poema' y recitó a Poe: qué prueba eso, y qué no

En 2023, un equipo de investigadores le pidió a ChatGPT que repitiera la palabra 'poema' sin parar, y el modelo acabó recitando 'El cuervo' de Poe palabra por palabra. Eso no prueba que los modelos guarden una copia de internet, pero tampoco que nunca memoricen nada: las dos afirmaciones son ciertas según el caso. Las cuatro preguntas que separan una demanda seria de un titular vacío.

7 min

Este sitio web utiliza cookies para mejorar la experiencia de navegación. Política de cookies.

↑↓ navegar ↵ abrir esc cerrar