Solari SolutionsEN

Articoli · Infrastruttura localebozza

Che cosa gira su una macchina in azienda, e quanto è lontano da ChatGPT e Claude

Pubblicato il · di Dario Solari · 6 min di lettura

I modelli aperti che un'azienda può far girare su un computer di sua proprietà sono sei mesi o un anno dietro i migliori modelli nel cloud. Il divario però non è uniforme. Sulle domande ai propri documenti quasi scompare; sulla conoscenza del mondo e sui compiti da esperto resta ampio.

Quando un'azienda valuta un sistema di intelligenza artificiale interno, la prima domanda è sempre la stessa: quanto è peggio di ChatGPT? La risposta dipende da due cose: quale macchina si è disposti a comprare, e che cosa si vuole farci. I numeri che seguono sono quelli pubblici al 2 ottobre 2026, con il limite che ogni classifica ha: misura ciò che misura.

Quattro macchine, quattro modelli

I modelli aperti si scaricano e girano senza inviare nulla all'esterno. Quello che cambia è la memoria disponibile.

MacchinaModello consigliatoLicenzaIndice AA
16–24 GB (Mac mini, portatile, scheda da gioco)Gemma 4 12B, Ministral 3 14BApache 2.014, 6
una scheda da 32 GB o un Mac da 36–64 GBQwen3.8-27BApache 2.034
128 GB (NVIDIA DGX Spark, Mac Studio)Qwen3.8-Flash-Next; gpt-oss-120bQwen Community 1.0; Apache 2.040; 12
256 GB (Mac Studio M5 Ultra)GLM-5.3-FlashMIT42

L'indice è quello di Artificial Analysis (versione 4.3.2), una media di prove di ragionamento, conoscenza, programmazione e uso di strumenti. Sulla stessa scala i migliori modelli nel cloud valgono oggi 58 (Claude Opus 5.5) e 53 (GPT-6 Astra, Gemini 4 Argon, Claude Fable 5.1).

Quanto indietro

Il modo più onesto di leggere il divario è per data. Qwen3.8-27B, uscito in agosto, vale 34: la frontiera di febbraio–marzo 2026 valeva tra 32 e 39. Al momento dell'uscita era quindi circa sei mesi indietro; rispetto a oggi, 24 punti. Gemma 4 31B (15) e gpt-oss-120b (12) stanno sotto GPT-5 dell'agosto 2025 (23): più di un anno.

Due studi recenti danno la stessa misura. Epoch AI, nel maggio 2026, stima in quattro mesi il ritardo del miglior modello aperto in assoluto, che però richiede un centro di calcolo. Il rapporto di Mozilla sull'intelligenza artificiale aperta, del settembre 2026, è più utile per un'azienda: il miglior modello che gira su una sola scheda grafica è 23 punti sotto la frontiera, il miglior modello su un singolo server 10 punti sotto.

Un'avvertenza che vale più della classifica: la frontiera è salita di oltre venti punti nel solo 2026. Un modello installato oggi sarà "un anno indietro" tra un anno qualunque sia. Un sistema interno va progettato per cambiare modello, non per tenerlo.

Dove sta il divario

Le prove di dettaglio dicono dove i modelli locali perdono e dove no. Confrontando Claude Opus 5.5 con Qwen3.8-27B:

  • Conoscenza del mondo. La prova Omniscience, che premia chi sa e chi ammette di non sapere, dà +46 al modello di Anthropic e −10 a Qwen; Gemma 4 e gpt-oss scendono a −48 e −49. Un modello locale non è un'enciclopedia e non conosce i fatti recenti: gpt-oss, per esempio, si ferma al maggio 2024.
  • Programmazione autonoma. Nelle prove in cui il modello lavora da solo in un terminale, 60% contro 6%.
  • Ragionamento da esperto. Sulle domande di livello accademico, 61% contro 34%.
  • Ragionamento sui documenti forniti. Qui il divario quasi scompare: su circa centomila parole di documenti, 85% contro 82%. È il caso d'uso tipico di un sistema aziendale, che risponde cercando nei file dell'azienda.
  • Fedeltà nel riassumere. Nella classifica di Vectara sulle invenzioni nei riassunti di un testo dato (22 settembre 2026), i modelli piccoli e aperti fanno meglio dei grandi: Gemma 4 26B inventa nel 5,2% dei casi e Qwen3 8B nel 4,8%, contro l'8,7% di GPT-6 Astra, il 10,4% di Gemini 3.1 Pro e il 10,9% di Claude Opus 4.5. Non tutti i modelli aperti, però: gpt-oss-120b arriva al 14,2%.

La lettura è questa: se le risposte devono venire dai documenti dell'azienda, un modello da 27 miliardi di parametri su una macchina da tremila euro fa il lavoro. Se devono venire dalla conoscenza del modello, o se il compito è un ragionamento aperto da specialista, serve la frontiera.

E l'italiano

Nessuna valutazione indipendente del 2026 copre ancora Qwen3.8 o Gemma 4 in italiano. Le prove disponibili, su modelli di un anno fa, dicono una cosa controintuitiva: i modelli internazionali piccoli battono quelli addestrati in Italia. Nel test ITALIC, pubblicato nel maggio 2026, Ministral 3 8B ottiene l'80–81%, Gemma 3 12B il 76–79%, Qwen3 8B il 73–77%; Velvet-14B il 67% e Minerva-7B il 35%. GPT-5 nano, il più piccolo modello di OpenAI, l'86–87%. Sulla parte italiana del test MMMLU, gpt-oss-120b vale 85 contro i 91 del modello chiuso o3. La differenza con il cloud c'è, ed è di qualche punto. Per i documenti di un'azienda l'unica prova che conta è quella sui documenti dell'azienda: è il primo passo di ogni nostra valutazione.

Licenze e velocità

Qwen3.8-27B, Gemma 4, gpt-oss, Mistral Small 4 e Ministral 3 sono distribuiti con licenza Apache 2.0; GLM con licenza MIT. Qwen3.8-Flash-Next ha una licenza propria che consente l'uso interno ma richiede un accordo a chi lo offre come servizio a terzi. Llama 4 di Meta esclude le aziende europee dai diritti sui modelli multimodali: non lo consigliamo.

La velocità su macchine di proprietà è adeguata a un piccolo ufficio. Qwen3.8-27B genera 59–75 parole-token al secondo su una scheda RTX 5090 e 48 su un Mac Studio M5 Ultra; sul DGX Spark 12 nella configurazione di base, 31–58 con le ottimizzazioni. gpt-oss-120b arriva a 60 sul DGX Spark e a 196 su una RTX PRO 6000. La lettura dei documenti, che è la fase che pesa quando si interroga un archivio, va da 3.000 a 10.000 token al secondo sulle schede NVIDIA.

Quanto costa

Un posto ChatGPT Business o Claude Team costa 20–25 dollari al mese; Microsoft 365 Copilot per le piccole imprese 18–25. Un modello da 27 miliardi di parametri su due schede economiche costa, ammortizzato, 13 centesimi per milione di token; la sola corrente, uno. Il confronto per un'azienda non si fa però sul prezzo per token: sotto i trenta–cinquanta utenti il cloud costa quanto o meno di un server in tre anni. La ragione per tenere i modelli in casa è un'altra, e l'abbiamo descritta altrove: i dati che non devono uscire.

Fonti

  • Artificial Analysis, Intelligence Index v4.3.2 e pagine di confronto dei modelli, lette il 2 ottobre 2026; Sub-32B open weights, 13 aprile 2026.
  • LMArena, classifica testo, 2 ottobre 2026.
  • Epoch AI, Open models lag state-of-the-art closed models by 4 months, 29 maggio 2026. Mozilla, The State of Open Source AI v1.1, 15 settembre 2026.
  • Vectara, Hallucination Leaderboard (HHEM-2.3), 22 settembre 2026.
  • Engineering, EngGPT2 benchmark, arXiv 2605.07731, 20 maggio 2026; OpenAI, gpt-oss model card, arXiv 2508.10925.
  • Schede dei modelli su Hugging Face: Qwen/Qwen3.8-27B, Qwen/Qwen3.8-Flash-Next (licenza), google/gemma-4-31B, mistralai/Mistral-Small-4-119B-2603; Meta, Llama 4 Community License.
  • Misure di velocità: llama.cpp, discussioni #15396 e #16578; Kubesimplify, agosto 2026; MacStories, settembre 2026; LLMKube, 23 aprile 2026.
  • Prezzi: claude.com/pricing, 2 ottobre 2026; prezzi di ChatGPT Business e Microsoft 365 Copilot da fonti secondarie, da ricontrollare.