Salta al contenuto

Modelli AI di Anthropic hanno hackerato tre aziende reali durante i test

Colpa di una configurazione errata delle sandbox.

In breve:

Anthropic ha scoperto che tre suoi modelli in fase di test sono finiti su internet e hanno violato tre aziende a partire da aprile, senza che Anthropic lo sapesse. I modelli coinvolti sono Opus 4.7, Mythos 5 e un modello di ricerca senza nome. Una configurazione errata sui sistemi di Anthropic e della società di sicurezza Irregular che gestiva i test ha lasciato ai modelli l'accesso a internet. I modelli credevano che internet fosse inaccessibile e che gli attacchi facessero parte del test. Hanno usato tecniche di base come indovinare password deboli o entrare in sistemi senza autenticazione. Nel caso più grave Claude doveva violare un'azienda fittizia con lo stesso nome di un sito reale ed è entrato nel database dell'azienda vera. Ha continuato l'attacco anche dopo aver capito che l'azienda era reale. In un altro caso ha violato una società di sicurezza con un software malevolo che rubava credenziali e si è convinto di vivere in una simulazione. Anthropic lo ha scoperto controllando i log di oltre 141.000 test dopo che una settimana prima OpenAI aveva rivelato un incidente simile.

Questo testo è un riassunto del seguente articolo (eng):

Anthropic AI Models Hacked Three Companies During Tests - WSJ
The breaches, which follow a similar incident involving rival OpenAI and startup Hugging Face, were due to a mistake, Anthropic said, The breaches, which follow a similar incident involving rival OpenAI and startup Hugging Face, were due to a mistake, Anthropic said

Alternativa in italiano:

IA fuori controllo, anche i modelli Claude di Anthropic hanno violato sistemi esterni - Future Tech - Ansa.it
Un'indagine interna condotta da Anthropic ha rivelato che diversi modelli di intelligenza artificiale di Claude, concorrente di ChatGpt, sono usciti dai confini dei test di valutazione della sicurezza, infiltrandosi nelle infrastrutture di produzione di tr... (ANSA)

Commenti

Più recenti