Solari SolutionsEN

Articoli · Infrastruttura localebozza

Due settimane in locale. ThePrimeagen e l'intelligenza artificiale in casa

Pubblicato il · di Dario Solari · 6 min di lettura

Uno dei programmatori più seguiti di internet, ex ingegnere di Netflix, a gennaio 2025 decide che i modelli offline sono "la strada giusta". Compra hardware, fa girare DeepSeek su sei schede grafiche prestate, scrive il suo assistente in quattro giorni. Poi smette. Il perché interessa a ogni azienda.

Michael Paulson è ThePrimeagen: ex ingegnere di Netflix, programmatore, streamer. I suoi canali YouTube superano insieme il milione e mezzo di iscritti, e il suo pubblico è fatto in gran parte di sviluppatori. È anche, da anni, uno degli scettici più rumorosi sull'intelligenza artificiale applicata al codice. Proprio per questo la sua storia con l'IA in casa vale la pena di essere raccontata: se c'è qualcuno che ha le competenze, i mezzi e la motivazione per farsela da sé, è lui.

Gennaio 2025: "i modelli offline sono la strada giusta"

Il 27 gennaio 2025 il mondo scopre DeepSeek R1, un modello cinese aperto che si può scaricare e far girare sulle proprie macchine. Paulson pubblica I Think I Love Deepseek R1: "Con mille dollari puoi comprare un hardware abbastanza buono da far girare qualcosa di piccolo e locale. Può essere completamente offline, solo per te, senza doverti preoccupare di tutto il resto: la raccolta dei dati, tutto quanto". E poi: "Per questo compro un paio di Mac Mini. Voglio costruirmi la mia piccola fattoria di Mac Mini".

Il ragionamento vale anche per le aziende, e lo dice lui stesso: "Ancora di più se lavori in un'azienda che non permette l'IA, potresti avere la tua versione offline". Di DeepSeek, peraltro, non si fida: "È per questo che lo voglio offline. Non voglio dargli accesso a internet, perché non so se chiama casa".

Due giorni dopo è ancora più netto: "Niente è più importante che avere i propri modelli offline. Sono sempre più convinto che sia la strada giusta: il tuo Raspberry Pi, i Mac Mini, le schede grafiche. È l'unico modo per non dipendere dalle grandi aziende". E annuncia: "Ho comprato Mac Mini per migliaia di dollari. Comprerò anche un sacco di Raspberry Pi".

Febbraio 2025: il muro delle schede grafiche

Il 2 febbraio va in diretta per comprare il necessario. Il video si intitola Why Buying GPUs Is a Disaster. "Pensavo davvero di venire qui oggi, comprare un paio di schede, una scheda madre, un po' di memoria, un alimentatore, un case, e chiudere la giornata. Non sapevo quanto mi sbagliavo." Le RTX 4090 si trovano solo su eBay, quasi tutte da Hong Kong e dalla Cina, a circa tremila dollari l'una. Le nuove 5090 sono esaurite il giorno stesso dell'uscita. Ripiega su un piano B: "Proverò a prendere delle 3090, è la cosa più semplice in questo momento". E intravede il problema successivo: "Mi fermerebbe l'elettricità molto prima. Dovrei affittare un locale apposta solo per risolvere la questione della corrente".

Due giorni dopo ce la fa, ma con le macchine di un altro. George Hotz, il fondatore di tinygrad, gli presta un server con sei RTX 4090. "Riesco a far girare DeepSeek R1, il modello completo, compresso a 1,5 bit, a circa dieci token al secondo su sei 4090. Grazie George Hotz." Dieci token al secondo sono più o meno la velocità di lettura di una persona: funziona, ma è lontano dall'esperienza di ChatGPT.

Quattro giorni di codice

Tra l'1 e il 6 febbraio scrive cockpit: un completamento automatico per Neovim, il suo editor, sullo stile di GitHub Copilot ma interamente locale. Il codice è pubblico. Un piccolo server in Go riceve le richieste dell'editor e le smista su più copie di llama.cpp, una per ogni scheda grafica. Trenta modifiche in sei giorni, con messaggi che raccontano il lavoro meglio di qualsiasi commento: "basic autocomplete finished", "slightly good server for spawning many llamas", "i hate models sometimes".

L'8 febbraio lo presenta in un video. In apertura una frase dice molto: "Sto usando il tinybox che George Hotz mi ha prestato, e come vedete in questo momento è occupato al cento per cento, quindi mentre registro non ho nemmeno accesso all'hardware". Lo definisce "tutta una prova di concetto". Dopo il 6 febbraio il progetto non riceve più nessuna modifica.

E poi il cloud

Da lì in avanti tutto quello che Paulson costruisce con l'intelligenza artificiale usa modelli nel cloud. A novembre 2025 pubblica 99, un assistente per Neovim che quasi cinquemila sviluppatori hanno segnato su GitHub: di base usa Claude, e non ha un'opzione per i modelli locali. "Usa un modello grande", spiega nel video. I suoi agenti del 2026 girano sull'infrastruttura di Cursor e su modelli a pagamento. A settembre 2026 David Heinemeier Hansson, il creatore di Ruby on Rails, lo chiama a guidare i test automatici di Omarchy, la sua distribuzione Linux. Lo strumento è costruito da Paulson, ma i modelli sono ospitati da altri.

La fattoria di Mac Mini, i Raspberry Pi e le 3090 non compaiono in nessun video successivo. A marzo 2026, commentando il sistema da dieci schede grafiche di PewDiePie, racconta di aver fatto portare più corrente nella stanza dove lavora: "Pensavo, forse dovrei costruirmi il mio rack di GPU. Non so, fratello. Non so se voglio tutto questo".

La diagnosi, sua

Il motivo lo aveva già spiegato lui, il 4 febbraio 2025, nel pieno dell'entusiasmo: "Non molte persone faranno girare i propri modelli. È costoso, è difficile, tenerli sempre in funzione non sarà facile, ed è praticamente impossibile trovare le schede grafiche". In un'altra puntata del suo podcast aggiunge: "Credo che i soldi stiano nell'integrazione, non nell'intelligenza artificiale in sé". Prima o poi si potranno far girare modelli potenti in locale, e a quel punto "conterà chi ha l'integrazione migliore".

Non ha cambiato idea sui dati. Commentando PewDiePie, nel novembre 2025, descrive ChatGPT come "una delle reti pubblicitarie più potenti che verranno mai costruite: non sanno solo che cosa hai chiesto, sanno su che cosa ti sei soffermato". La convinzione è rimasta. Il lavoro di tenere in piedi le macchine no.

Che cosa insegna a un'azienda

La storia di Paulson non dice che l'intelligenza artificiale in casa non funziona: in due settimane, con hardware prestato, lui l'ha fatta funzionare. Dice che farla funzionare una volta è la parte facile. Il resto è comprare l'hardware giusto nel momento in cui scarseggia, dimensionare corrente e raffreddamento, tenere i server accesi quando servono, aggiornare i modelli, collegarli agli strumenti che le persone usano davvero. Sono esattamente le voci della sua diagnosi: costo, difficoltà, continuità, integrazione.

Per un programmatore che lavora da solo, rinunciare è una scelta ragionevole: il suo codice non è un segreto professionale e i suoi dati sono soprattutto suoi. Per uno studio legale, un commercialista o un'azienda con i progetti dei clienti nei propri archivi il conto è diverso. Le ragioni per tenere i dati in casa sono le stesse che Paulson aveva a gennaio 2025, solo più pesanti. La differenza la fa chi si occupa del resto.