Bloom convierte una hipótesis sobre la conducta de una IA en una evaluación reproducible
Anthropic ha abierto un sistema que genera escenarios, ejecuta conversaciones y juzga si un modelo muestra una conducta definida. Su utilidad depende de conservar la semilla, revisar al juez y no confundir una prueba provocada con incidencia real.