{"id":62587,"date":"2026-07-22T09:28:09","date_gmt":"2026-07-22T08:28:09","guid":{"rendered":"https:\/\/alground.com\/site\/?p=62587"},"modified":"2026-07-22T09:28:21","modified_gmt":"2026-07-22T08:28:21","slug":"gpt-red-lia-di-openai-che-attacca-chatgpt-per-renderlo-piu-sicuro","status":"publish","type":"post","link":"https:\/\/alground.com\/site\/gpt-red-lia-di-openai-che-attacca-chatgpt-per-renderlo-piu-sicuro\/62587\/","title":{"rendered":"GPT-Red: l\u2019IA di OpenAI che attacca ChatGPT per renderlo pi\u00f9 sicuro"},"content":{"rendered":"<div id=\"ez-toc-container\" class=\"ez-toc-v2_0_85 counter-hierarchy ez-toc-counter ez-toc-grey ez-toc-container-direction\">\n<p class=\"ez-toc-title\" style=\"cursor:inherit\">Punti chiave<\/p>\n<label for=\"ez-toc-cssicon-toggle-item-6a60a4c51fc30\" class=\"ez-toc-cssicon-toggle-label\"><span class=\"\"><span class=\"eztoc-hide\" style=\"display:none;\">Toggle<\/span><span class=\"ez-toc-icon-toggle-span\"><svg style=\"fill: #999;color:#999\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" class=\"list-377408\" width=\"20px\" height=\"20px\" viewBox=\"0 0 24 24\" fill=\"none\"><path d=\"M6 6H4v2h2V6zm14 0H8v2h12V6zM4 11h2v2H4v-2zm16 0H8v2h12v-2zM4 16h2v2H4v-2zm16 0H8v2h12v-2z\" fill=\"currentColor\"><\/path><\/svg><svg style=\"fill: #999;color:#999\" class=\"arrow-unsorted-368013\" xmlns=\"http:\/\/www.w3.org\/2000\/svg\" width=\"10px\" height=\"10px\" viewBox=\"0 0 24 24\" version=\"1.2\" baseProfile=\"tiny\"><path d=\"M18.2 9.3l-6.2-6.3-6.2 6.3c-.2.2-.3.4-.3.7s.1.5.3.7c.2.2.4.3.7.3h11c.3 0 .5-.1.7-.3.2-.2.3-.5.3-.7s-.1-.5-.3-.7zM5.8 14.7l6.2 6.3 6.2-6.3c.2-.2.3-.5.3-.7s-.1-.5-.3-.7c-.2-.2-.4-.3-.7-.3h-11c-.3 0-.5.1-.7.3-.2.2-.3.5-.3.7s.1.5.3.7z\"\/><\/svg><\/span><\/span><\/label><input type=\"checkbox\"  id=\"ez-toc-cssicon-toggle-item-6a60a4c51fc30\"  aria-label=\"Toggle\" \/><nav><ul class='ez-toc-list ez-toc-list-level-1 ' ><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-1\" href=\"https:\/\/alground.com\/site\/gpt-red-lia-di-openai-che-attacca-chatgpt-per-renderlo-piu-sicuro\/62587\/#Il_problema_delle_istruzioni_nascoste\" >Il problema delle istruzioni nascoste<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-2\" href=\"https:\/\/alground.com\/site\/gpt-red-lia-di-openai-che-attacca-chatgpt-per-renderlo-piu-sicuro\/62587\/#Come_viene_addestrato_GPT-Red\" >Come viene addestrato GPT-Red<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-3\" href=\"https:\/\/alground.com\/site\/gpt-red-lia-di-openai-che-attacca-chatgpt-per-renderlo-piu-sicuro\/62587\/#GPT-Red_contro_gli_esseri_umani\" >GPT-Red contro gli esseri umani<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-4\" href=\"https:\/\/alground.com\/site\/gpt-red-lia-di-openai-che-attacca-chatgpt-per-renderlo-piu-sicuro\/62587\/#Il_distributore_automatico_manipolato\" >Il distributore automatico manipolato<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-5\" href=\"https:\/\/alground.com\/site\/gpt-red-lia-di-openai-che-attacca-chatgpt-per-renderlo-piu-sicuro\/62587\/#La_scoperta_degli_attacchi_%E2%80%9CFake_Chain-of-Thought%E2%80%9D\" >La scoperta degli attacchi \u201cFake Chain-of-Thought\u201d<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-6\" href=\"https:\/\/alground.com\/site\/gpt-red-lia-di-openai-che-attacca-chatgpt-per-renderlo-piu-sicuro\/62587\/#Unintelligenza_artificiale_che_migliora_la_propria_sicurezza\" >Un\u2019intelligenza artificiale che migliora la propria sicurezza<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-7\" href=\"https:\/\/alground.com\/site\/gpt-red-lia-di-openai-che-attacca-chatgpt-per-renderlo-piu-sicuro\/62587\/#Perche_GPT-Red_restera_segreto\" >Perch\u00e9 GPT-Red rester\u00e0 segreto<\/a><\/li><li class='ez-toc-page-1 ez-toc-heading-level-2'><a class=\"ez-toc-link ez-toc-heading-8\" href=\"https:\/\/alground.com\/site\/gpt-red-lia-di-openai-che-attacca-chatgpt-per-renderlo-piu-sicuro\/62587\/#La_nuova_corsa_tra_intelligenze_artificiali_offensive_e_difensive\" >La nuova corsa tra intelligenze artificiali offensive e difensive<\/a><\/li><\/ul><\/nav><\/div>\n\n<p class=\"wp-block-paragraph\"><strong>OpenAI ha sviluppato un\u2019intelligenza artificiale specializzata nell\u2019attaccare altri modelli di intelligenza artificiale.<\/strong> Si chiama GPT-Red e il suo compito \u00e8 individuare vulnerabilit\u00e0, sperimentare nuove forme di manipolazione e generare attacchi sempre pi\u00f9 sofisticati contro i sistemi GPT.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">L\u2019obiettivo, almeno apparentemente paradossale, \u00e8 utilizzare un modello offensivo per rendere pi\u00f9 sicuri quelli destinati agli utenti. GPT-Red non \u00e8 quindi un nuovo chatbot commerciale e non verr\u00e0 messo a disposizione del pubblico. \u00c8 uno strumento interno di sicurezza, progettato per agire come un red teamer automatico e sottoporre i modelli di OpenAI a una pressione continua.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La societ\u00e0 sostiene che questo sistema abbia gi\u00e0 contribuito all\u2019addestramento di GPT-5.6 Sol, descritto come il modello pi\u00f9 resistente alle iniezioni di prompt realizzato finora da OpenAI. Secondo i dati diffusi dall\u2019azienda, GPT-5.6 Sol registra un numero di errori sei volte inferiore nel benchmark pi\u00f9 difficile dedicato alle iniezioni dirette rispetto al miglior modello disponibile appena quattro mesi prima. <\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"Il_problema_delle_istruzioni_nascoste\"><\/span>Il problema delle istruzioni nascoste<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Per comprendere l\u2019importanza di GPT-Red bisogna partire da una delle vulnerabilit\u00e0 pi\u00f9 serie dell\u2019intelligenza artificiale generativa: la prompt injection.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Un normale utente comunica con un modello scrivendo istruzioni. Lo stesso modello, per\u00f2, pu\u00f2 ricevere informazioni anche da pagine web, documenti, email, repository di codice, applicazioni collegate o risultati prodotti da altri strumenti. Un aggressore pu\u00f2 nascondere all\u2019interno di questi contenuti una seconda istruzione, concepita per entrare in conflitto con la richiesta originale dell\u2019utente.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>L\u2019intelligenza artificiale rischia cos\u00ec di scambiare un contenuto esterno per un comando da eseguire.<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Un utente potrebbe chiedere al sistema di riassumere un documento, mentre nel documento \u00e8 stata inserita un\u2019istruzione invisibile o apparentemente innocua che ordina al modello di copiare informazioni riservate, inviare credenziali a un server esterno, modificare un pagamento oppure ignorare le regole di sicurezza.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">OWASP, una delle organizzazioni di riferimento per la sicurezza delle applicazioni, classifica la prompt injection come il primo rischio della propria graduatoria dedicata alle applicazioni basate su grandi modelli linguistici. L\u2019attacco consiste nella manipolazione dell\u2019input per alterare il comportamento del modello, aggirarne le difese o indurlo a compiere azioni non previste. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Il pericolo aumenta con la diffusione degli agenti autonomi. Un chatbot tradizionale si limita principalmente a produrre testo. Un agente pu\u00f2 invece consultare file, leggere la posta elettronica, utilizzare strumenti, modificare documenti, interagire con siti web, eseguire codice o avviare procedure operative.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Pi\u00f9 capacit\u00e0 operative vengono affidate all\u2019intelligenza artificiale, maggiori sono le conseguenze di una sua eventuale manipolazione.<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Anche la stampa israeliana specializzata in tecnologia e sicurezza ha descritto la prompt injection come una tecnica attraverso la quale un aggressore inserisce istruzioni malevole in contenuti apparentemente normali, inducendo un agente a esporre informazioni riservate, eseguire codice o effettuare operazioni indesiderate. Le analisi in lingua ebraica sottolineano soprattutto il rischio dell\u2019agent hijacking, cio\u00e8 la possibilit\u00e0 di prendere indirettamente il controllo del comportamento di un agente attraverso testi manipolati. <\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"Come_viene_addestrato_GPT-Red\"><\/span>Come viene addestrato GPT-Red<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Il red teaming \u00e8 una pratica consolidata nella sicurezza informatica. Un gruppo di specialisti assume temporaneamente il ruolo dell\u2019aggressore e tenta di violare un sistema prima che possa farlo un criminale.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Nel settore dell\u2019intelligenza artificiale questo lavoro richiede la costruzione di prompt ingannevoli, scenari realistici, tentativi di jailbreak e attacchi capaci di sfruttare il modo in cui il modello interpreta linguaggio e contesto.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Il problema \u00e8 la scala. I ricercatori umani possono trovare vulnerabilit\u00e0 particolarmente creative, ma non possono generare e verificare milioni di varianti con la velocit\u00e0 necessaria per seguire l\u2019evoluzione dei modelli.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">GPT-Red nasce per superare questo limite. Il sistema invia un prompt al modello bersaglio, osserva la risposta, valuta il risultato e modifica l\u2019attacco. Il processo continua fino al raggiungimento dell\u2019obiettivo oppure fino all\u2019esaurimento delle strategie disponibili.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>GPT-Red non esegue soltanto una raccolta di attacchi gi\u00e0 conosciuti. Impara a produrne di nuovi attraverso un processo competitivo.<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">OpenAI lo addestra mediante apprendimento per rinforzo in self-play. GPT-Red interpreta la parte dell\u2019attaccante, mentre un insieme diversificato di modelli assume quella dei difensori. L\u2019attaccante riceve una ricompensa quando provoca un errore valido. I difensori vengono invece premiati quando resistono alla manipolazione e completano correttamente il compito richiesto dall\u2019utente.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Quando i difensori migliorano, gli attacchi pi\u00f9 semplici smettono di funzionare. GPT-Red \u00e8 quindi costretto a cercare tecniche pi\u00f9 complesse, creative e difficili da riconoscere. Il risultato \u00e8 una corsa agli armamenti controllata all\u2019interno dell\u2019ambiente di addestramento. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">OpenAI afferma di aver dedicato al progetto una quantit\u00e0 di potenza di calcolo paragonabile ad alcune delle sue maggiori operazioni di post-addestramento. Si tratterebbe di un investimento computazionale eccezionale per un modello destinato esclusivamente alla sicurezza. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Questa impostazione non \u00e8 isolata nel panorama della ricerca. Studi recenti come PISmith utilizzano l\u2019apprendimento per rinforzo per addestrare modelli offensivi capaci di ottimizzare iniezioni di prompt contro sistemi protetti. I risultati indicano che anche alcune delle difese pi\u00f9 avanzate restano vulnerabili quando gli attacchi possono adattarsi dinamicamente alle risposte del bersaglio. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Un altro progetto, PI-Hunter, costruisce scenari realistici in cui istruzioni malevole vengono nascoste in fonti esterne. Il sistema modifica progressivamente i casi di test in base alle reazioni dell\u2019agente, con l\u2019obiettivo di identificare non soltanto se esiste una vulnerabilit\u00e0, ma anche dove nasce e come si propaga durante l\u2019esecuzione di un compito. <\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"GPT-Red_contro_gli_esseri_umani\"><\/span>GPT-Red contro gli esseri umani<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Uno dei risultati pi\u00f9 significativi riguarda il confronto con i red teamer umani. OpenAI ha testato GPT-Red in nuovi ambienti, differenti da quelli utilizzati durante l\u2019addestramento, per verificare se il sistema fosse in grado di generalizzare.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Nel test basato su una versione interna dell\u2019arena per le iniezioni indirette sviluppata da Dziemian e altri ricercatori, GPT-Red e gli specialisti umani dovevano proporre attacchi contro GPT-5.1.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>GPT-Red avrebbe completato con successo l\u2019attacco nell\u201984 per cento degli scenari, mentre gli esseri umani si sarebbero fermati al 13 per cento.<\/strong> <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Il risultato non dimostra necessariamente che l\u2019intelligenza artificiale sia pi\u00f9 intelligente di un esperto di sicurezza. Indica piuttosto che un modello automatizzato pu\u00f2 provare molte pi\u00f9 varianti, analizzare immediatamente ogni risposta e continuare a modificare la strategia senza stanchezza.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Il confronto presenta inoltre alcuni limiti. I dati sono stati pubblicati dalla stessa OpenAI, il benchmark \u00e8 stato replicato internamente e non sono ancora disponibili tutti i dettagli tecnici necessari per una valutazione indipendente completa. La societ\u00e0 ha annunciato la pubblicazione di un preprint pi\u00f9 approfondito, che dovrebbe consentire alla comunit\u00e0 scientifica di esaminare metodologia, criteri di successo e possibili limitazioni. <\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"Il_distributore_automatico_manipolato\"><\/span>Il distributore automatico manipolato<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Per mettere alla prova GPT-Red fuori dai benchmark teorici, OpenAI lo ha utilizzato contro un distributore automatico gestito da un agente di intelligenza artificiale all\u2019interno dei propri uffici.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Il sistema, prodotto da Andon Labs, amministrava prezzi, disponibilit\u00e0 e ordini. GPT-Red ha inizialmente sperimentato gli attacchi in una simulazione, osservando le chiamate agli strumenti e adattando progressivamente le istruzioni. L\u2019attacco \u00e8 stato successivamente trasferito all\u2019agente in produzione.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Secondo OpenAI, GPT-Red \u00e8 riuscito a raggiungere tre obiettivi. Ha ridotto a 50 centesimi il prezzo di un prodotto costoso gi\u00e0 presente nel distributore, ha ordinato un nuovo articolo da oltre 100 dollari per rivenderlo allo stesso prezzo minimo e ha annullato l\u2019ordine di un altro cliente. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>Il caso del distributore mostra che la prompt injection non riguarda soltanto risposte sbagliate o contenuti indesiderati. Pu\u00f2 produrre conseguenze economiche e operative nel mondo reale.<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">OpenAI ha comunicato le vulnerabilit\u00e0 al produttore e ha dichiarato che nuove protezioni sono in fase di sperimentazione. Non sono stati tuttavia resi pubblici tutti i dettagli degli attacchi, una scelta comprensibile dal punto di vista della sicurezza, ma che limita la possibilit\u00e0 di verificare dall\u2019esterno l\u2019effettiva gravit\u00e0 delle falle.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">GPT-Red \u00e8 stato utilizzato anche contro un agente Codex da riga di comando basato su GPT-5.4 mini. La prova comprendeva dieci scenari di esfiltrazione di dati sensibili. Il sistema offensivo si \u00e8 dimostrato pi\u00f9 efficace e pi\u00f9 efficiente nell\u2019uso dei token rispetto a un modello GPT-5.5 guidato da un normale prompt di red teaming. <\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"La_scoperta_degli_attacchi_%E2%80%9CFake_Chain-of-Thought%E2%80%9D\"><\/span>La scoperta degli attacchi \u201cFake Chain-of-Thought\u201d<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">Uno dei risultati pi\u00f9 interessanti prodotti dalle versioni preliminari di GPT-Red \u00e8 l\u2019individuazione di una nuova categoria di attacchi diretti chiamata \u201cFake Chain-of-Thought\u201d.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">In questa tecnica, il contenuto malevolo viene presentato come se fosse una parte del ragionamento interno gi\u00e0 prodotto o autorizzato dal modello. L\u2019aggressore tenta quindi di confondere il sistema riguardo alla provenienza e al livello gerarchico dell\u2019istruzione.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Le prime versioni dell\u2019attacco avrebbero ottenuto un tasso di successo superiore al 95 per cento contro GPT-5.1. Dopo l\u2019addestramento avversariale, lo stesso valore sarebbe sceso sotto il 10 per cento su GPT-5.6 Sol.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Una vulnerabilit\u00e0 simile, definita anche CoT Forgery, \u00e8 stata analizzata da ricercatori che hanno mostrato come un modello possa essere ingannato attraverso ragionamenti contraffatti, costruiti per far apparire legittima una richiesta che dovrebbe essere respinta. L\u2019attacco sfrutta il fatto che alcuni modelli riconoscono la gerarchia delle istruzioni anche attraverso stile, struttura e formulazione del testo, non soltanto attraverso marcatori tecnici affidabili. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Il dato pi\u00f9 rilevante non \u00e8 soltanto la scoperta dell\u2019attacco. \u00c8 la possibilit\u00e0 di trasformare automaticamente ogni vulnerabilit\u00e0 riuscita in materiale di addestramento per il modello successivo.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"Unintelligenza_artificiale_che_migliora_la_propria_sicurezza\"><\/span>Un\u2019intelligenza artificiale che migliora la propria sicurezza<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">OpenAI utilizza i precursori di GPT-Red nell\u2019addestramento dei modelli di produzione a partire da GPT-5.3. Il meccanismo consiste nel generare attacchi sempre pi\u00f9 efficaci e presentarli ai modelli difensori, in modo che imparino a riconoscerli e a resistere.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">L\u2019azienda afferma che GPT-5.6 Sol fallisce soltanto nello 0,05 per cento delle iniezioni dirette prodotte da GPT-Red all\u2019interno di una vasta raccolta di ambienti di robustezza. Alcuni benchmark dedicati alle iniezioni indirette nei sistemi di navigazione e negli strumenti per sviluppatori avrebbero inoltre superato il 97 per cento di accuratezza. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Questi numeri devono essere interpretati con cautela. Una buona prestazione nei benchmark interni non equivale alla risoluzione definitiva del problema. Le iniezioni di prompt possono assumere forme imprevedibili, dipendono dal contesto e cambiano quando vengono modificati gli strumenti disponibili all\u2019agente.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>La sicurezza di un sistema non pu\u00f2 essere dimostrata soltanto dal fatto che resiste agli attacchi prodotti dal modello con cui \u00e8 stato addestrato.<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Per questa ragione OpenAI dichiara di valutare GPT-Red anche su scenari esclusi dall\u2019addestramento. La societ\u00e0 sostiene inoltre che continuer\u00e0 ad affiancare al sistema automatico il red teaming umano, le verifiche di soggetti esterni, il monitoraggio in tempo reale e protezioni disposte su pi\u00f9 livelli.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Le fonti arabe che hanno seguito l\u2019evoluzione delle misure di sicurezza di OpenAI hanno posto particolare attenzione sul cosiddetto Lockdown Mode, una modalit\u00e0 pensata per ridurre l\u2019esposizione dei dati sensibili limitando l\u2019interazione del modello con fonti e sistemi esterni. La copertura in lingua araba evidenzia un punto centrale: nei contesti pi\u00f9 delicati, aumentare la sicurezza pu\u00f2 richiedere anche una riduzione delle capacit\u00e0 operative disponibili all\u2019agente. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">OpenAI, al contrario, sostiene che i miglioramenti ottenuti con GPT-Red non derivino da un modello diventato semplicemente pi\u00f9 prudente o incline a rifiutare le richieste. L\u2019azienda dichiara di aver verificato separatamente le capacit\u00e0 generali e i casi di rifiuto eccessivo, senza rilevare una diminuzione significativa delle prestazioni normali. <\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"Perche_GPT-Red_restera_segreto\"><\/span>Perch\u00e9 GPT-Red rester\u00e0 segreto<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">GPT-Red non verr\u00e0 distribuito al pubblico. OpenAI vuole mantenere separate le capacit\u00e0 offensive del sistema dai modelli commerciali, trasferendo soltanto la maggiore resistenza ottenuta durante l\u2019addestramento.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La scelta pone una questione delicata. Un modello capace di individuare automaticamente vulnerabilit\u00e0, produrre prompt malevoli e perfezionare attacchi contro agenti reali potrebbe diventare uno strumento molto potente anche nelle mani di criminali informatici.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>GPT-Red \u00e8 utile proprio perch\u00e9 possiede competenze che potrebbero essere pericolose se diffuse senza controllo.<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Il progetto rappresenta quindi un esempio evidente del carattere duale della ricerca sulla sicurezza. Le stesse tecniche utilizzate per scoprire e correggere una vulnerabilit\u00e0 possono essere impiegate per sfruttarla.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">La ricerca indipendente sta gi\u00e0 procedendo nella stessa direzione. Framework automatici come AutoRed, AgenticRed ed EVA utilizzano modelli generativi, cicli di feedback e sistemi evolutivi per produrre attacchi pi\u00f9 vari, adattivi e trasferibili tra modelli differenti. Alcuni esperimenti mostrano che le istruzioni malevole sviluppate contro un agente possono funzionare anche contro sistemi forniti da aziende diverse, indicando la presenza di debolezze comportamentali condivise. <\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Questo significa che la sfida non riguarda esclusivamente OpenAI. Riguarda qualsiasi azienda che affidi a un modello linguistico l\u2019accesso a dati, account, strumenti o procedure aziendali.<\/p>\n\n\n\n<h2 class=\"wp-block-heading\"><span class=\"ez-toc-section\" id=\"La_nuova_corsa_tra_intelligenze_artificiali_offensive_e_difensive\"><\/span>La nuova corsa tra intelligenze artificiali offensive e difensive<span class=\"ez-toc-section-end\"><\/span><\/h2>\n\n\n\n<p class=\"wp-block-paragraph\">GPT-Red segna un passaggio importante nella storia della sicurezza informatica. Per anni gli esseri umani hanno attaccato i sistemi per trovare errori. Ora un\u2019intelligenza artificiale pu\u00f2 produrre attacchi contro un\u2019altra intelligenza artificiale, trasformando i successi dell\u2019aggressore nell\u2019addestramento del difensore.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">OpenAI descrive questo processo come un volano di auto-miglioramento. I modelli attuali vengono impiegati per rendere pi\u00f9 sicura la generazione successiva. La nuova generazione, diventata pi\u00f9 resistente, obbliga il red teamer automatico a sviluppare tecniche ancora pi\u00f9 sofisticate.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\"><strong>La sicurezza smette cos\u00ec di essere una verifica effettuata soltanto alla fine dello sviluppo e diventa una competizione continua incorporata nell\u2019addestramento stesso.<\/strong><\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Resta per\u00f2 un interrogativo fondamentale. Se gli attaccanti artificiali diventeranno sempre pi\u00f9 capaci, le loro competenze potranno essere davvero confinate negli ambienti controllati delle grandi aziende? E quanto a lungo le difese riusciranno a precedere tecniche offensive che possono essere generate automaticamente anche da soggetti esterni?<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">GPT-Red mostra una possibile risposta, ma anche la dimensione del problema. L\u2019intelligenza artificiale pu\u00f2 contribuire a correggere le proprie debolezze, purch\u00e9 i test non rimangano chiusi all\u2019interno di benchmark costruiti dagli stessi sviluppatori e purch\u00e9 il controllo umano continui ad avere un ruolo reale.<\/p>\n\n\n\n<p class=\"wp-block-paragraph\">Il futuro degli agenti digitali dipender\u00e0 dalla loro capacit\u00e0 di distinguere una richiesta legittima da un ordine nascosto, di rispettare le autorizzazioni e di arrestarsi davanti a un\u2019azione irreversibile. <strong>Un agente che sa ragionare, navigare e utilizzare strumenti deve anche imparare a non obbedire alla voce sbagliata.<\/strong><\/p>\n","protected":false},"excerpt":{"rendered":"<p>OpenAI ha sviluppato un\u2019intelligenza artificiale specializzata nell\u2019attaccare altri modelli di intelligenza artificiale. Si chiama GPT-Red e il suo compito \u00e8 individuare vulnerabilit\u00e0, sperimentare nuove forme di manipolazione e generare attacchi sempre pi\u00f9 sofisticati contro i sistemi GPT. L\u2019obiettivo, almeno apparentemente paradossale, \u00e8 utilizzare un modello offensivo per rendere pi\u00f9 sicuri quelli destinati agli utenti. GPT-Red [&hellip;]<\/p>\n","protected":false},"author":11,"featured_media":62589,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"","format":"standard","meta":{"om_disable_all_campaigns":false,"pmpro_default_level":"","_monsterinsights_skip_tracking":false,"_monsterinsights_sitenote_active":false,"_monsterinsights_sitenote_note":"","_monsterinsights_sitenote_category":0,"footnotes":""},"categories":[1413,2168],"tags":[],"class_list":["post-62587","post","type-post","status-publish","format-standard","has-post-thumbnail","category-attualita","category-intelligenza-artificiale","pmpro-has-access"],"aioseo_notices":[],"aioseo_head":"\n\t\t<!-- All in One SEO Pro 4.9.10 - aioseo.com -->\n\t<meta name=\"description\" content=\"OpenAI presenta GPT-Red, un\u2019intelligenza artificiale che genera attacchi e prompt injection contro i modelli GPT per scoprire vulnerabilit\u00e0, proteggere i dati e rendere GPT-5.6 pi\u00f9 sicuro.\" \/>\n\t<meta name=\"robots\" content=\"max-image-preview:large\" \/>\n\t<meta name=\"author\" content=\"Carlo Feder\"\/>\n\t<meta name=\"google-site-verification\" content=\"uXIDMontx6A-5jxjAAuTv_CtdoyW0fZ-TE172a9ELeg\" \/>\n\t<link rel=\"canonical\" href=\"https:\/\/alground.com\/site\/gpt-red-lia-di-openai-che-attacca-chatgpt-per-renderlo-piu-sicuro\/62587\/\" \/>\n\t<meta name=\"generator\" content=\"All in One SEO Pro (AIOSEO) 4.9.10\" \/>\n\t\t<meta property=\"og:locale\" content=\"it_IT\" \/>\n\t\t<meta property=\"og:site_name\" content=\"Alground | Tecnologia - Cyberwarfare - Intelligenza Artificiale\" \/>\n\t\t<meta property=\"og:type\" content=\"article\" \/>\n\t\t<meta property=\"og:title\" content=\"GPT-Red: l\u2019IA di OpenAI che attacca ChatGPT per renderlo pi\u00f9 sicuro | Alground\" \/>\n\t\t<meta property=\"og:description\" content=\"OpenAI presenta GPT-Red, un\u2019intelligenza artificiale che genera attacchi e prompt injection contro i modelli GPT per scoprire vulnerabilit\u00e0, proteggere i dati e rendere GPT-5.6 pi\u00f9 sicuro.\" \/>\n\t\t<meta property=\"og:url\" content=\"https:\/\/alground.com\/site\/gpt-red-lia-di-openai-che-attacca-chatgpt-per-renderlo-piu-sicuro\/62587\/\" \/>\n\t\t<meta property=\"og:image\" content=\"https:\/\/alground.com\/site\/wp-content\/uploads\/2026\/07\/openaired.jpg\" \/>\n\t\t<meta property=\"og:image:secure_url\" content=\"https:\/\/alground.com\/site\/wp-content\/uploads\/2026\/07\/openaired.jpg\" \/>\n\t\t<meta property=\"og:image:width\" content=\"1100\" \/>\n\t\t<meta property=\"og:image:height\" content=\"550\" \/>\n\t\t<meta property=\"article:published_time\" content=\"2026-07-22T08:28:09+00:00\" \/>\n\t\t<meta property=\"article:modified_time\" content=\"2026-07-22T08:28:21+00:00\" \/>\n\t\t<meta property=\"article:publisher\" content=\"https:\/\/www.facebook.com\/AlgroundGeopoliticaAlessandroTrizio\" \/>\n\t\t<meta name=\"twitter:card\" content=\"summary_large_image\" \/>\n\t\t<meta name=\"twitter:site\" content=\"@Alground\" \/>\n\t\t<meta name=\"twitter:title\" content=\"GPT-Red: l\u2019IA di OpenAI che attacca ChatGPT per renderlo pi\u00f9 sicuro | Alground\" \/>\n\t\t<meta name=\"twitter:description\" content=\"OpenAI presenta GPT-Red, un\u2019intelligenza artificiale che genera attacchi e prompt injection contro i modelli GPT per scoprire vulnerabilit\u00e0, proteggere i dati e rendere GPT-5.6 pi\u00f9 sicuro.\" \/>\n\t\t<meta name=\"twitter:creator\" content=\"@Alground\" \/>\n\t\t<meta name=\"twitter:image\" content=\"https:\/\/alground.com\/site\/wp-content\/uploads\/2026\/05\/Logo-tondo.png\" \/>\n\t\t<!-- All in One SEO Pro -->\r\n\t\t<title>GPT-Red: l\u2019IA di OpenAI che attacca ChatGPT per renderlo pi\u00f9 sicuro | Alground<\/title>\n\n","aioseo_head_json":{"title":"GPT-Red: l\u2019IA di OpenAI che attacca ChatGPT per renderlo pi\u00f9 sicuro | Alground","description":"OpenAI presenta GPT-Red, un\u2019intelligenza artificiale che genera attacchi e prompt injection contro i modelli GPT per scoprire vulnerabilit\u00e0, proteggere i dati e rendere GPT-5.6 pi\u00f9 sicuro.","canonical_url":"https:\/\/alground.com\/site\/gpt-red-lia-di-openai-che-attacca-chatgpt-per-renderlo-piu-sicuro\/62587\/","robots":"max-image-preview:large","keywords":"","webmasterTools":{"google-site-verification":"uXIDMontx6A-5jxjAAuTv_CtdoyW0fZ-TE172a9ELeg","miscellaneous":""},"schema":null,"og:locale":"it_IT","og:site_name":"Alground | Tecnologia - Cyberwarfare - Intelligenza Artificiale","og:type":"article","og:title":"GPT-Red: l\u2019IA di OpenAI che attacca ChatGPT per renderlo pi\u00f9 sicuro | Alground","og:description":"OpenAI presenta GPT-Red, un\u2019intelligenza artificiale che genera attacchi e prompt injection contro i modelli GPT per scoprire vulnerabilit\u00e0, proteggere i dati e rendere GPT-5.6 pi\u00f9 sicuro.","og:url":"https:\/\/alground.com\/site\/gpt-red-lia-di-openai-che-attacca-chatgpt-per-renderlo-piu-sicuro\/62587\/","og:image":"https:\/\/alground.com\/site\/wp-content\/uploads\/2026\/07\/openaired.jpg","og:image:secure_url":"https:\/\/alground.com\/site\/wp-content\/uploads\/2026\/07\/openaired.jpg","og:image:width":1100,"og:image:height":550,"article:published_time":"2026-07-22T08:28:09+00:00","article:modified_time":"2026-07-22T08:28:21+00:00","article:publisher":"https:\/\/www.facebook.com\/AlgroundGeopoliticaAlessandroTrizio","twitter:card":"summary_large_image","twitter:site":"@Alground","twitter:title":"GPT-Red: l\u2019IA di OpenAI che attacca ChatGPT per renderlo pi\u00f9 sicuro | Alground","twitter:description":"OpenAI presenta GPT-Red, un\u2019intelligenza artificiale che genera attacchi e prompt injection contro i modelli GPT per scoprire vulnerabilit\u00e0, proteggere i dati e rendere GPT-5.6 pi\u00f9 sicuro.","twitter:creator":"@Alground","twitter:image":"https:\/\/alground.com\/site\/wp-content\/uploads\/2026\/05\/Logo-tondo.png"},"aioseo_meta_data":{"post_id":"62587","title":null,"description":"OpenAI presenta GPT-Red, un\u2019intelligenza artificiale che genera attacchi e prompt injection contro i modelli GPT per scoprire vulnerabilit\u00e0, proteggere i dati e rendere GPT-5.6 pi\u00f9 sicuro.","keywords":null,"keyphrases":{"focus":{"keyphrase":"","score":0,"analysis":{"keyphraseInTitle":{"score":0,"maxScore":9,"error":1}}},"additional":[]},"primary_term":null,"canonical_url":null,"og_title":null,"og_description":null,"og_object_type":"default","og_image_type":"default","og_image_url":null,"og_image_width":null,"og_image_height":null,"og_image_custom_url":null,"og_image_custom_fields":null,"og_video":"","og_custom_url":null,"og_article_section":null,"og_article_tags":null,"twitter_use_og":false,"twitter_card":"default","twitter_image_type":"default","twitter_image_url":null,"twitter_image_custom_url":null,"twitter_image_custom_fields":null,"twitter_title":null,"twitter_description":null,"schema":{"blockGraphs":[],"customGraphs":[],"default":{"data":{"Article":[],"Course":[],"Dataset":[],"FAQPage":[],"Movie":[],"Person":[],"Product":[],"ProductReview":[],"Car":[],"Recipe":[],"Service":[],"SoftwareApplication":[],"WebPage":[]},"graphName":"Article","isEnabled":true},"graphs":[]},"schema_type":"default","schema_type_options":null,"pillar_content":false,"robots_default":true,"robots_noindex":false,"robots_noarchive":false,"robots_nosnippet":false,"robots_nofollow":false,"robots_noimageindex":false,"robots_noodp":false,"robots_notranslate":false,"robots_max_snippet":"-1","robots_max_videopreview":"-1","robots_max_imagepreview":"large","priority":null,"frequency":"default","local_seo":null,"seo_analyzer_scan_date":"2026-07-22 08:35:23","breadcrumb_settings":null,"limit_modified_date":false,"open_ai":null,"ai":{"faqs":[],"keyPoints":[],"schemas":[],"titles":[],"descriptions":[],"socialPosts":{"email":{"subject":"","preview":"","content":""},"linkedin":[],"twitter":[],"facebook":[],"instagram":[]}},"created":"2026-07-22 08:10:05","updated":"2026-07-22 08:35:23","reviewed_by":"0"},"aioseo_breadcrumb":"<div class=\"aioseo-breadcrumbs\"><span class=\"aioseo-breadcrumb\">\n\t<a href=\"https:\/\/alground.com\/site\" title=\"Home\">Home<\/a>\n<\/span><span class=\"aioseo-breadcrumb-separator\">&raquo;<\/span><span class=\"aioseo-breadcrumb\">\n\t<a href=\"https:\/\/alground.com\/site\/category\/attualita\/\" title=\"Attualit\u00e0\">Attualit\u00e0<\/a>\n<\/span><span class=\"aioseo-breadcrumb-separator\">&raquo;<\/span><span class=\"aioseo-breadcrumb\">\n\tGPT-Red: l\u2019IA di OpenAI che attacca ChatGPT per renderlo pi\u00f9 sicuro\n<\/span><\/div>","aioseo_breadcrumb_json":[{"label":"Home","link":"https:\/\/alground.com\/site"},{"label":"Attualit\u00e0","link":"https:\/\/alground.com\/site\/category\/attualita\/"},{"label":"GPT-Red: l\u2019IA di OpenAI che attacca ChatGPT per renderlo pi\u00f9 sicuro","link":"https:\/\/alground.com\/site\/gpt-red-lia-di-openai-che-attacca-chatgpt-per-renderlo-piu-sicuro\/62587\/"}],"jetpack_featured_media_url":"https:\/\/alground.com\/site\/wp-content\/uploads\/2026\/07\/openaired.jpg","wps_subtitle":"","_links":{"self":[{"href":"https:\/\/alground.com\/site\/wp-json\/wp\/v2\/posts\/62587","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/alground.com\/site\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/alground.com\/site\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/alground.com\/site\/wp-json\/wp\/v2\/users\/11"}],"replies":[{"embeddable":true,"href":"https:\/\/alground.com\/site\/wp-json\/wp\/v2\/comments?post=62587"}],"version-history":[{"count":1,"href":"https:\/\/alground.com\/site\/wp-json\/wp\/v2\/posts\/62587\/revisions"}],"predecessor-version":[{"id":62588,"href":"https:\/\/alground.com\/site\/wp-json\/wp\/v2\/posts\/62587\/revisions\/62588"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/alground.com\/site\/wp-json\/wp\/v2\/media\/62589"}],"wp:attachment":[{"href":"https:\/\/alground.com\/site\/wp-json\/wp\/v2\/media?parent=62587"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/alground.com\/site\/wp-json\/wp\/v2\/categories?post=62587"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/alground.com\/site\/wp-json\/wp\/v2\/tags?post=62587"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}