Solari SolutionsEN

Articoli · Consulenzabozza

Quanto fidarsi di ChatGPT e Claude con i dati dell'azienda

Pubblicato il · di Dario Solari · 7 min di lettura

OpenAI e Anthropic promettono di non addestrare i modelli sui dati delle aziende e di cancellarli in trenta giorni. Le promesse sono scritte e certificate. Quello che non promettono, e quello che nessun contratto può coprire, è ciò che conta nella scelta.

Chi affida documenti a un servizio di intelligenza artificiale nel cloud dovrebbe porsi tre domande. I dati vengono usati per addestrare i modelli? Per quanto tempo restano sui server del fornitore? Chi può leggerli, e in base a quale legge? Le risposte sono nelle pagine contrattuali dei fornitori, lette il 2 ottobre 2026, e cambiano molto da un piano all'altro.

OpenAI

Addestramento. Sui piani individuali di ChatGPT (Free, Go, Plus, Pro) le conversazioni sono usate per addestrare i modelli, salvo disattivazione nelle impostazioni. Sui piani aziendali (Business, Enterprise, Edu) e sulle API non lo sono, se l'azienda non lo autorizza esplicitamente.

Conservazione. Le conversazioni cancellate vengono eliminate entro trenta giorni, "salvo che la conservazione sia richiesta per motivi legali o di sicurezza". Le API tengono per trenta giorni registri di controllo degli abusi; su richiesta, e per usi qualificati, OpenAI concede la zero data retention, cioè nessuna conservazione dei contenuti. Sul piano Business il personale di OpenAI e "contraenti terzi specializzati" possono accedere alle conversazioni per verifiche sugli abusi.

La clausola "salvo obblighi di legge" alla prova. Nel maggio 2025 un tribunale di New York, nella causa del New York Times contro OpenAI, ha ordinato la conservazione di tutte le conversazioni che sarebbero state cancellate. L'ordine ha coperto i piani individuali, il piano Team e le API senza accordo di zero data retention; non ha coperto Enterprise né, in prospettiva, le conversazioni originate nello Spazio economico europeo. È durato fino al 26 settembre 2025. Nel gennaio 2026 il giudice ha confermato l'ordine di consegnare agli editori un campione di venti milioni di conversazioni, rese anonime. La lezione è semplice: ciò che esiste su un server americano può essere richiesto da un tribunale americano.

Residenza europea. Dal febbraio 2025 OpenAI offre la conservazione dei dati in Europa per le API e per i nuovi clienti Enterprise ed Edu. Il piano Business non è nell'elenco. Anche con l'elaborazione in regione, alcune fasi (l'estrazione del testo dai documenti, l'instradamento, l'autenticazione) "possono avvenire fuori dalla regione scelta". Il contratto è con OpenAI Ireland, ma i trasferimenti verso le società del gruppo fuori dall'Unione sono previsti, con le clausole contrattuali standard.

Anthropic

Addestramento. Dall'agosto 2025 gli utenti dei piani individuali di Claude scelgono se le conversazioni possono essere usate per l'addestramento; chi accetta vede la conservazione salire a cinque anni, chi rifiuta resta a trenta giorni. I piani commerciali (API, Team, Enterprise) sono esclusi dall'addestramento.

Conservazione. Trenta giorni, con eccezioni fino a due anni per violazioni delle condizioni d'uso. La zero data retention esiste, per organizzazione e tramite l'ufficio commerciale, ma non copre i modelli più recenti (le famiglie Fable 5 e Mythos 5), che richiedono la conservazione di trenta giorni.

Residenza. Sulle API e sulle applicazioni di Anthropic l'unica regione di conservazione disponibile è quella statunitense. L'Europa è raggiungibile solo attraverso Amazon Bedrock o Google Cloud, dove il responsabile del trattamento diventa il fornitore cloud.

Per completezza: Microsoft Copilot e Google Workspace con Gemini dichiarano entrambi di non addestrare i modelli sui dati dei clienti e offrono la conservazione in Europa; Microsoft avverte che nei momenti di picco le chiamate ai modelli possono essere servite in altre regioni, e che i modelli Anthropic sono esclusi dal perimetro europeo.

Anonimizzazione: che cosa esiste

Nessuno dei fornitori anonimizza ciò che riceve. Non c'è una funzione che tolga nomi, codici fiscali o importi da un documento prima che il modello lo legga. Le misure offerte sono altre: non addestrare, non conservare, conservare in regione, cifrare con chiavi del cliente. Microsoft, su Azure, vende a parte un servizio di rilevamento dei dati personali che può sostituirli con segnaposto, ma è un componente da integrare, non un'impostazione.

L'anonimizzazione, se si vuole, va fatta prima dell'invio, in azienda: un software intermedio riconosce i dati personali, li sostituisce con segnaposto, conserva la tabella di corrispondenza solo in locale e la riapplica alla risposta. Strumenti aperti come Presidio di Microsoft servono a questo. Due limiti vanno detti.

Il primo è giuridico. Per il GDPR i dati pseudonimizzati restano dati personali per chi detiene la chiave, cioè per l'azienda; la Corte di giustizia lo ha ribadito nel settembre 2025. La pseudonimizzazione è una misura di sicurezza, non un'uscita dagli obblighi.

Il secondo è pratico. Il riconoscimento automatico toglie i nomi, non il contesto: la descrizione di un caso identifica una persona anche senza il nome. E molto di ciò che un'azienda vuole proteggere non è un dato personale: un prezzo, un disegno, un listino, un pezzo di codice. Uno studio dell'aprile 2026 che ha confrontato otto tecniche di redazione ha trovato che la combinazione migliore non lasciava passare dati personali, ma lasciava passare il 31% del codice proprietario.

Quanto fidarsi

Le politiche di OpenAI e Anthropic sono serie, scritte e certificate (SOC 2, ISO 27001). Negli incidenti degli ultimi tre anni il punto debole raramente è stato il server del fornitore. I dati aziendali sono usciti in tre modi.

  • Dipendenti che incollano dati in un servizio individuale. Il caso di Samsung, nel 2023: codice sorgente e verbali di riunione in ChatGPT, tre volte in venti giorni.
  • Istruzioni nascoste nei documenti. Nel giugno 2025 una falla in Microsoft 365 Copilot (EchoLeak) permetteva, con una semplice e-mail, di far trasmettere file interni a un server esterno senza alcuna azione dell'utente; nel settembre 2025 una falla analoga in ChatGPT (ShadowLeak). Entrambe corrette, nessuna sfruttata per quanto si sa; entrambe possibili per costruzione.
  • Funzioni che pubblicano per progetto. Nell'estate 2025 migliaia di conversazioni condivise da ChatGPT sono finite indicizzate da Google; nel settembre 2026 OpenAI ha confermato che propri agenti avevano pubblicato immagini caricate da utenti che avevano acconsentito all'addestramento.

A questi si aggiunge la giurisdizione. Nel giugno 2025 il direttore legale di Microsoft Francia ha dichiarato sotto giuramento al Senato francese di non poter garantire che i dati dei clienti francesi non vengano consegnati alle autorità americane. La residenza dei dati in Europa non cambia la legge a cui il fornitore risponde.

Che cosa resta a carico dell'azienda

Qualunque sia il fornitore, l'azienda resta titolare del trattamento: deve avere una base giuridica, informare le persone i cui dati finiscono nei documenti, firmare un contratto di nomina a responsabile (i piani individuali non lo prevedono), valutare l'impatto quando i dati sono sensibili o riguardano i dipendenti. I professionisti devono inoltre dire ai clienti quali sistemi usano, come richiede la legge 132/2025.

Una regola di lavoro

La fiducia non è una questione di marchio ma di contratto e di tipo di dato. Un criterio praticabile divide i dati in tre classi.

  1. Informazioni non riservate (testi pubblici, bozze generiche, traduzioni di materiale già diffuso): un servizio cloud con contratto aziendale va bene.
  2. Dati personali di clienti e dipendenti: piano aziendale con contratto di nomina, conservazione zero dove disponibile, pseudonimizzazione prima dell'invio; oppure un sistema interno.
  3. Segreto professionale, proprietà intellettuale, dati sanitari: un sistema che gira in azienda e non trasmette nulla all'esterno.

La maggior parte delle aziende usa tutte e tre le classi ogni giorno. Decidere quale strumento serve per ciascuna è il lavoro da fare prima di scegliere il fornitore.

Fonti

  • OpenAI, How your data is used to improve model performance; Enterprise privacy; Data controls (API); Data residency for ChatGPT; Response to NYT data demands; Data Processing Addendum v.010126.
  • U.S. District Court S.D.N.Y., In re OpenAI, 25-md-3143, ordinanza del 5 gennaio 2026.
  • Anthropic, Updates to Consumer Terms and Privacy Policy (28 agosto 2025); API and data retention; Data residency; Data Processing Addendum.
  • Microsoft Learn, Data, Privacy, and Security for Microsoft Copilot; Azure AI Language, PII detection. Google, Workspace AI privacy.
  • Corte di giustizia dell'Unione europea, causa C-413/23 P, 4 settembre 2025. Regolamento (UE) 2016/679, considerando 26 e art. 4, 28, 32, 35.
  • LLM-Redactor, arXiv 2604.12064, aprile 2026. Microsoft Presidio, GitHub.
  • Checkmarx e arXiv 2509.10540 su EchoLeak (CVE-2025-32711); The Register su ShadowLeak; TechCrunch e Bloomberg sul caso Samsung; Search Engine Land sulle conversazioni indicizzate; Reuters sulle immagini pubblicate (26 settembre 2026).
  • Audizione al Senato francese, 10 giugno 2025 (Microsoft Francia).