Articoli · Infrastruttura localebozza
Un modello di intelligenza artificiale su una blockchain. Che cosa gira davvero su ICP, e che cosa no
Pubblicato il · di Daniil Tolmacov · 6 min di lettura
L'Internet Computer promette intelligenza artificiale «on-chain», verificabile e senza un unico fornitore cloud. Abbiamo controllato che cosa ha girato davvero dentro la blockchain, quanto costa, e dove finisce il prompt nel servizio più pubblicizzato.
Chi ha lavorato nell'ecosistema dell'Internet Computer, come chi scrive, che vi ha sviluppato in Rust per il portafoglio Plug, si sente fare spesso la stessa domanda: si può far girare un modello di intelligenza artificiale su una blockchain? Per ICP la risposta breve è sì, ma solo modelli piccoli, lentamente e a caro prezzo. E il servizio che oggi si presenta come «LLM su ICP» non fa girare i modelli sulla blockchain.
La domanda non riguarda solo chi si occupa di criptovalute. Riguarda chiunque debba scegliere dove far girare l'intelligenza artificiale e a chi affidare i propri dati. Una blockchain e un server in azienda sono due modi diversi di non dipendere da un unico fornitore cloud, con conseguenze opposte sulla riservatezza.
Che cosa ha girato davvero
Su ICP i programmi si chiamano canister: codice WebAssembly eseguito da tutti i nodi di una sottorete, che devono arrivare allo stesso risultato. Nel luglio 2024 DFINITY, la fondazione che sviluppa la rete, ha completato la tappa chiamata Cyclotron: aritmetica in virgola mobile deterministica e istruzioni SIMD hanno reso il calcolo dei canister circa dieci volte più veloce. Sono girati così, interamente dentro la blockchain, un classificatore di immagini (MobileNet), il riconoscimento di volti e GPT-2.
Dal 2024 il progetto open source llama_cpp_canister di onicai porta dentro un canister llama.cpp, lo stesso motore che si usa per i modelli locali su un portatile. Le misure pubblicate nel suo repository, aggiornato a ottobre 2026, sono queste:
| Modello | Parametri, quantizzazione | Token per chiamata |
|---|---|---|
| Gemma 3 270M | 0,27 miliardi, 8 bit | 44 |
| Qwen3 0.6B | 0,6 miliardi, 8 bit | 25 |
| LFM2.5 1.2B | 1,2 miliardi, 4 bit | 9 |
| Qwen3 1.7B | 1,7 miliardi, 4 bit | 6 |
| LFM2.5 2.6B | 2,7 miliardi, 4 bit | 4 |
Nel luglio 2026 tre ricercatori indipendenti hanno fatto girare un modello da 3,9 miliardi di parametri a 2 bit, con risposte identiche byte per byte su tutti i tredici nodi della sottorete. È il risultato più grande documentato. Un modello da 7–8 miliardi, la taglia minima di un assistente utile in ufficio, sulla blockchain non gira.
Perché così piccoli
I limiti sono tre. Ogni chiamata può eseguire al massimo 40 miliardi di istruzioni, circa venti secondi di calcolo; per questo il testo esce a pezzi di pochi token, e una risposta breve richiede minuti. La memoria utilizzabile è di circa 4 GB. E non ci sono GPU: la tappa successiva, Gyrotron, annunciata nel 2024 proprio per portare le schede grafiche nella rete, a ottobre 2026 non risulta consegnata.
Poi c'è il punto che rende una blockchain una blockchain: ogni nodo della sottorete ripete lo stesso calcolo. Una risposta è calcolata tredici volte. Con i costi pubblicati da onicai, Qwen3 1.7B costa sulla rete circa 6.000 dollari per milione di token generati, LFM2.5 1.2B circa 1.900; lo stesso milione di token con Llama 3.1 8B, un modello cinque volte più grande, presso un comune fornitore costa otto centesimi.
Il servizio che si chiama «LLM su ICP»
Nel febbraio 2025 DFINITY ha presentato l'«LLM canister», oggi chiamato anche Intelligence Gateway: poche righe di codice per usare Llama 3.1 8B, poi Qwen3 32B e Llama 4 Scout, da un canister. Sul forum della fondazione gli stessi ingegneri hanno spiegato come funziona. Il canister mette in coda le richieste; a elaborarle sono «AI worker», macchine fuori dalla blockchain gestite da DFINITY, che in questa prima versione usavano «un fornitore esterno». A giugno 2025 hanno precisato: «siamo limitati ai modelli disponibili su OpenRouter», un comune intermediario commerciale di modelli. E ad agosto, a proposito delle chiamate a servizi esterni: si resta fuori dalla blockchain, quindi «non c'è consenso né verifica» che il risultato non sia stato alterato.
La documentazione attuale indica invece «Onchain (ICP nodes)» come luogo dell'elaborazione. Non abbiamo trovato alcun annuncio di questo cambiamento, nella rete non ci sono le GPU che servirebbero per un modello da 8 miliardi a velocità utilizzabile, e una domanda pubblica di settembre 2026 su dove siano ospitati i modelli è rimasta senza risposta. Fino a prova contraria, il prompt esce dalla blockchain, viene elaborato da una macchina che nessuno nella rete può controllare, e la blockchain registra la risposta senza poterla verificare.
Verificabile non vuol dire riservato
Quando il modello gira davvero dentro un canister, ICP offre qualcosa che un server non offre: chiunque può ricostruire il codice, controllare quale modello ha risposto e sapere che nessun singolo nodo ha alterato il risultato. È una garanzia reale, e ha un prezzo che va detto chiaramente.
La documentazione di sicurezza di DFINITY scrive: «Gli operatori dei nodi delle sottoreti applicative standard possono leggere la memoria dei canister». Un prompt elaborato sulla blockchain sta in chiaro nella memoria di tredici macchine, in tredici centri dati, gestite da tredici operatori che l'azienda non conosce. Le chiavi crittografiche della rete (vetKeys) proteggono i dati conservati, non il calcolo sui dati. Le sottoreti con ambienti di esecuzione protetti esistono dal 2026: sono due, hanno sette nodi e nessuna GPU.
Per un contratto, una busta paga o una cartella clinica la domanda che viene prima non è «quale modello ha risposto?», ma «chi altro ha visto questi dati?».
Dove ha senso
Un piccolo modello sulla blockchain ha senso quando la verificabilità conta più della riservatezza e della velocità: una classificazione automatica legata a un pagamento o a un registro pubblico, una decisione che deve poter essere ripetuta e controllata da chiunque, un agente che gestisce fondi. Per tutto il resto, gli stessi modelli da 0,5–2 miliardi di parametri girano molto più velocemente su un normale server d'ufficio, e se serve una prova di quale modello ha risposto si può pubblicare l'impronta del modello e dei dati in ingresso.
Tre domande per qualsiasi fornitore
L'etichetta «on-chain» merita la stessa verifica che meritano «privato», «sicuro» o «in Europa» su qualsiasi servizio di intelligenza artificiale. Le domande sono tre, e valgono anche per noi.
- Dove gira fisicamente il modello? Su quale macchina, di chi, in quale paese.
- Chi può leggere il prompt? Il fornitore, i suoi intermediari, gli operatori dei nodi.
- Si può verificare quale modello ha risposto? Con quale versione, e con quali dati.
Un sistema locale risponde alle prime due nel modo più semplice: su una macchina dell'azienda, e solo chi l'azienda autorizza. Alla terza si risponde registrando versioni e richieste. La blockchain risponde bene alla terza e male alla seconda. Sapere quale delle tre conta di più, caso per caso, è il primo passo di ogni scelta.
Fonti
- DFINITY, «The Next Step for DeAI: On-Chain Inference Enabling Face Recognition», 15 luglio 2024 (copia Wayback Machine).
- onicai,
llama_cpp_canister, README e schede dei modelli, GitHub, ottobre 2026; forum DFINITY, discussione «llama.cpp on the Internet Computer», 2024–2026. - J. Aerni, S. Fluck, D. Becker, «On-Chain LLM Inference Under Instruction Budgets», Zenodo, luglio 2026, doi 10.5281/zenodo.20607598; forum DFINITY, 21–22 luglio 2026.
- Forum DFINITY, «Introducing the LLM Canister», febbraio–agosto 2025; repository
caffeinelabs/llm; documentazione ICP «AI inference», «Resource limits», «Cycle costs», «Security model», «VetKeys», consultate il 3 ottobre 2026. - Forum DFINITY, «Upcoming proposal: the first TEE-enabled subnet», febbraio–settembre 2026.
- OpenRouter, listino pubblico dei modelli, 3 ottobre 2026.