Commentaires : Anthropic : Claude Mythos déraille et créé de fausses indentités pour tromper les vérifications humaines

L’AI Security Institute britannique a révélé mardi qu’un agent IA développé par Anthropic avait tenté de manipuler un administrateur humain pour lui faire approuver du code malveillant, dans le cadre d’une série d’incidents impliquant des modèles d’AI.

https://clubic.com//actualite-624223-anthropic-claude-mythos-deraille-et-cree-de-fausses-indentites-pour-tromper-les-verifications-humaines.html

Et qui peut me garantir que les prochains à désactiver les mécanismes de prévention des abus ne seront pas des gens avec d’autres motivation que des tests en laboratoire ?

3 « J'aime »

En même temps, elle porte bien son nom

1 « J'aime »

Heureusement que ce n’étaient que de fausses indentités, on a eu chaud :smirking_face: