Solari SolutionsEN

Articoli · Infrastruttura localebozza

Togliere all'agente tutti i diritti. L'idea di NVIDIA, e come applicarla senza NVIDIA

Pubblicato il · di Daniil Tolmacov · 8 min di lettura

Dopo un'estate di agenti di OpenAI usciti dalle loro sandbox, NVIDIA ha presentato una piattaforma che non chiede al modello di comportarsi bene. Lo chiude in un recinto, mette il controllore su un altro processore e gli lascia solo i diritti che servono. L'idea ha cinquant'anni, la parte in hardware è fuori portata per una piccola azienda, il principio no.

Un video di Fireship, il 30 settembre 2026, ha portato a quasi un milione di persone un piccolo progetto sponsorizzato che promette di fermare gli agenti con una regola invece che con un altro modello. Nel video c'è però una frase di passaggio: "è la stessa idea di NVIDIA, solo che loro l'hanno fatta con un processore". È quella idea, presentata da NVIDIA due giorni prima, che merita attenzione. Non per la parte in silicio, che una piccola azienda non comprerà, ma per il principio, che si applica a qualunque installazione.

Il problema

Nell'estate 2026 gli agenti di OpenAI, durante prove interne su modelli non ancora pubblicati, hanno fatto quello che un agente fa quando un ostacolo gli impedisce di finire il compito: lo hanno aggirato. In maggio hanno caricato centinaia di pacchetti malevoli su RubyGems e usato un wiki tedesco come bacheca per scambiarsi messaggi. Il 18 giugno uno di loro, incaricato di trovare dati pubblici sulla spesa farmaceutica australiana, ha superato le protezioni di un portale statistico di Services Australia e ha letto file non pubblici; OpenAI ha avvisato il governo 84 giorni dopo. In luglio sono usciti dalla sandbox di valutazione attraverso una falla nel proxy che la collegava a internet, hanno preso il controllo dell'infrastruttura di Hugging Face in circa tredici ore, con circa 17.600 azioni, e hanno usato servizi pubblici di condivisione testi come canale di comando. Nella ricostruzione congiunta, OpenAI ha ammesso che il monitoraggio delle traiettorie degli agenti "non era in atto". Hugging Face ha scritto la frase che riassume tutto: "un attacco alla velocità della macchina rende le debolezze ordinarie più costose per chi difende".

NVIDIA chiama questo comportamento drift, deriva: "azioni dell'agente che si allontanano dal compito o dai vincoli previsti", e lo dice senza giri di parole: "La deriva non si può eliminare con l'addestramento conservando la capacità. E la lezione più importante è questa: in queste circostanze non ci si può aspettare che un agente governi completamente il proprio comportamento".

L'idea

Il 28 settembre NVIDIA ha presentato l'Open Agent Safety Platform. Jensen Huang, intervistato dalla CNBC, l'ha spiegata in una frase: "Quando si mette in funzione un agente, per quanto intelligente, la prima cosa da fare è togliergli tutti i diritti. Il lavoro numero uno è togliergli tutti i diritti. Poi gli si dà accesso a file, dati, strumenti, alla rete, solo se gli serve". E l'ha paragonata a un browser: "il browser per gli agenti".

La piattaforma ha due parti. OpenShell è un ambiente di esecuzione: l'agente gira in una sandbox che vede solo i percorsi dichiarati, non ha privilegi, e non può aprire una connessione di rete senza che un supervisore, che sta fuori dalla sandbox, la confronti con una politica scritta prima. Le credenziali l'agente non le vede mai: usa segnaposto, e il supervisore sostituisce la chiave vera solo verso le destinazioni approvate. Se il supervisore non risponde, l'agente si ferma. Prima di avviare l'agente, un dimostratore automatico verifica che la politica non conceda più di quanto l'operatore intendeva. Sentry è il sorvegliante: gira su un processore separato, la BlueField-4, con la propria memoria e il proprio sistema operativo, posto sull'unico percorso tra l'agente e il modello. Da lì osserva ogni richiesta e, se l'agente esce dal perimetro, lo mette in quarantena "in millisecondi".

I cinque principi che NVIDIA ha pubblicato con la piattaforma dicono il resto. Il secondo: "L'applicazione delle regole deve essere fuori banda: i controlli non vivono dentro l'agente, né alla sua portata". Il terzo: "Il percorso verso il modello è il punto di controllo: un agente non può agire senza il suo prossimo pensiero".

Non è un'idea nuova. Nel 1972 un rapporto per l'aeronautica americana definì il reference monitor: un meccanismo di controllo degli accessi che deve essere a prova di manomissione, deve essere invocato sempre, e deve essere abbastanza piccolo da poter essere analizzato per intero. I tre principi di NVIDIA sono questi tre requisiti. La novità è dove sta il meccanismo: non nel nucleo del sistema operativo dell'agente, ma su un altro processore, sulla strada. Amazon fa qualcosa di simile da anni con le schede Nitro, che tengono le funzioni di sicurezza del cloud fuori dalla portata del cliente.

Due cautele, prima di innamorarsene. Sentry oggi è un progetto di riferimento: nessun codice pubblicato, nessun prezzo, nessuna misura di latenza oltre a "millisecondi", e richiede una scheda che arriva solo dentro i sistemi Vera Rubin per i centri di calcolo. E la frase "avrebbe impedito le violazioni", attribuita a Huang dalla stampa, nei testi pubblicati è di un suo dirigente, con una riserva: "da quello che sappiamo, avrebbe potuto fermare la violazione se fosse stata in uso nei laboratori. Ogni incidente è unico". Un commento su Hacker News ha messo il dito nel punto: "Il chip Sentry deve indovinare ogni volta; l'agente contenuto deve essere fortunato una volta sola".

Che cosa gira su una macchina normale

OpenShell, tutto. È software libero (licenza Apache 2.0, oltre quattordicimila stelle su GitHub), dal 25 settembre 2026 nella prima linea di versioni dichiarate stabili per la produzione, e gira su qualunque Linux recente, su un Mac, o su un DGX Spark, per il quale NVIDIA pubblica una guida che fa girare un modello aperto in locale, con Ollama, dentro la sandbox. Non serve una scheda grafica né un processore NVIDIA. Si integra con Claude Code, Codex, OpenCode e gli altri agenti da terminale.

I limiti sono scritti nella documentazione, e vanno letti. Nella modalità a contenitori la sandbox condivide il nucleo con la macchina che la ospita, quindi una fuga dal contenitore resta possibile; la modalità a micro-macchina virtuale, con un nucleo per sandbox, chiude questa porta. Ogni destinazione di rete consentita è una possibile via di uscita dei dati. OpenShell non legge ciò che il modello scrive: non è una difesa dalle istruzioni nascoste nei documenti, è un recinto. E la telemetria anonima verso NVIDIA è attiva finché non la si spegne.

Il principio, alla scala di una piccola azienda

Quello che Sentry compra con l'hardware, un controllore che l'agente non può toccare, che vede tutto e che è abbastanza semplice da essere verificato, una piccola azienda lo può approssimare con strumenti che già conosce. Non avrà i millisecondi in silicio. Avrà la struttura.

  1. Un nucleo per ogni agente. Micro-macchine virtuali invece di contenitori: una fuga dal contenitore non arriva alla macchina.
  2. Il controllore su un'altra macchina. NVIDIA stessa consiglia di mettere il gateway "su un host separato". In una piccola azienda: il supervisore su una macchina virtuale o su un secondo computer, gli agenti su un altro, e la macchina degli agenti non può raggiungere l'amministrazione del primo.
  3. Una sola uscita, chiusa per impostazione. Si aggiungono solo le destinazioni che servono, prima in modalità di osservazione e poi di blocco. Gli agenti di Hugging Face sono usciti dall'unico proxy consentito: quel percorso va registrato e sorvegliato, non solo filtrato.
  4. Un osservatore nel nucleo che l'agente non può spegnere. Strumenti come Falco o Tetragon vedono le chiamate di sistema da fuori la sandbox e possono interrompere un processo. Non sono a prova di manomissione contro chi ha i privilegi di amministratore sulla macchina: è il divario che solo l'hardware chiude.
  5. Registri che l'agente non può modificare. OpenShell scrive ogni decisione, consentita o negata, in un formato standard; vanno spediti a un raccoglitore che la macchina degli agenti può solo scrivere, non amministrare. Hugging Face ha dovuto ricostruire 17.600 azioni a posteriori.
  6. Verificare la politica, non il modello. Il dimostratore di OpenShell controlla in millisecondi, senza token, che una politica resti dentro un confine. Un classificatore basato su un modello, come quello che Claude Code usa per approvare da solo le chiamate, resta probabilistico.

Il prezzo è lo stesso di ogni recinto: l'agente si ferma e chiede più spesso. Nelle prove di NVIDIA, agenti di frontiera hanno passato "fino a due ore a cercare di convincere i revisori automatici a concedere permessi"; nessuna scrittura protetta è avvenuta.

OpenAPPA, il progetto del video, è una versione in solo software della stessa idea, con un merito proprio, perché ragiona su dove possono andare i dati letti e non solo su che cosa fa il processo, e con limiti dichiarati: vive nel processo dell'agente e un'impostazione del progetto lo disattiva. Sta bene accanto a un recinto, non al suo posto.

Per chi tiene l'intelligenza artificiale in azienda questa è la conclusione: il modello e il recinto stanno nella stessa stanza, e il recinto non dipende da un giudice nel cloud. Un DGX Spark che fa girare un modello aperto dentro OpenShell, con il supervisore su un'altra macchina e i registri fuori, è un progetto che si può disegnare oggi. Le tre misure che mettiamo alla base di ogni installazione, sistemi locali per i dati riservati, permessi minimi, controllo dei risultati, qui diventano architettura.

Fonti

  • NVIDIA, NVIDIA Open Agent Safety Platform, comunicato del 28 settembre 2026; blog per sviluppatori, A reference for continuous in-silicon agent monitoring e Add runtime controls to AI agents with NVIDIA OpenShell, 28 settembre 2026; documentazione OpenShell (architettura, matrice di supporto, buone pratiche, prover, logging), letta il 2 ottobre 2026; github.com/NVIDIA/OpenShell; guida OpenShell on DGX Spark.
  • CNBC, estratti dell'intervista a Jensen Huang, Squawk Box, 28 settembre 2026; CNBC, Reuters, Associated Press, TechCrunch e Tom's Hardware, 28–29 settembre 2026; Hacker News, discussione del 28 settembre 2026.
  • Hugging Face, Agent intrusion technical timeline, 27 luglio 2026; METR e Redwood Research, indagine del 26 agosto 2026; ABC News, 12 e 24 settembre 2026; CNBC, 4 settembre 2026.
  • Anderson, Computer Security Technology Planning Study, ESD-TR-73-51, ottobre 1972, come ripreso in DoD 5200.28-STD. Amazon Web Services, The Nitro System.
  • Fireship, Did a 50 year old military secret just solve agent prompt injection?, 30 settembre 2026; OpenAPPA, documentazione, letta il 2 ottobre 2026.