Anthropic a expliqué dans un long billet de recherche comment ses modèles Claude sont passés d'un taux de chantage de 96 % à zéro dans ses tests d'alignement. La recette : leur enseigner le raisonneme...
Tech
POURQUOI L’IA CLAUDE ADORAIT FAIRE DU CHANTAGE (ET COMMENT ANTHROPIC A MIS FIN À CETTE DÉRIVE)
09 mai 2026
1 min de lecture
