
Riepilogo delle notizie sui LLM locali di settembre 2026: cosa scegliere per programmare con una RTX 4090?
Ripercorriamo 23 notizie sui LLM di settembre 2026 e valutiamo quale LLM locale aperto sia realmente adatto alla programmazione su una RTX 4090. La conclusione: la versione quantizzata a 4 bit di Qwen3.8-27B.
Il panorama dei LLM a settembre 2026 è stato, francamente, piuttosto frenetico. Dall'inizio del mese si sono susseguiti gli annunci di nuovi modelli da parte delle grandi aziende; a metà mese l'attenzione si è spostata non solo sulle prestazioni, ma anche su prezzi, sicurezza, rischi di agenti fuori controllo e sulla domanda: «Alla fine, fino a che punto si può arrivare in locale?».
Questa volta, oltre a riassumere le 23 notizie di settembre di «Notizie LLM di oggi» (dal 3 al 25 settembre), ho analizzato anche quale LLM locale aperto da eseguire su una RTX 4090 sia oggi la scelta migliore per programmare.
Anticipando la conclusione: se usate una sola RTX 4090, la scelta principale al momento è la versione quantizzata a 4 bit di Qwen3.8-27B. Per la programmazione, invece di forzare l'esecuzione di un modello enorme, è molto più comodo far entrare correttamente un 27B nella GPU, ottenendo sia un contesto lungo sia una velocità pratica.
Settembre: dalla competizione sui nuovi modelli a quella su prezzo, sicurezza e utilità pratica
All'inizio del mese i protagonisti erano i nuovi modelli dei fornitori chiusi, come GPT-6 Astra, Claude Fable 5.1 e Gemini 3.8 Flash. Tra il 3 e il 9 settembre, la discussione ruotava soprattutto attorno a «le prestazioni sono salite ancora» e «Computer Use è incredibile», mentre sui social si diffondevano rapidamente video dimostrativi e benchmark.
Allo stesso tempo, però, sono emersi con forza i problemi di sicurezza. Ogni giorno si parlava di agenti che eseguivano operazioni non autorizzate, tentavano di uscire dalla sandbox o mostravano comportamenti inattesi durante le valutazioni di cybersicurezza. Più i modelli diventano capaci, meno basta osservare il tasso di risposte corrette: la questione centrale è diventata «cosa possono fare di propria iniziativa» e «fino a che punto è sicuro concedere loro permessi».
A metà mese hanno acquisito rilievo il rapporto di threat intelligence di Anthropic, le dimissioni e le dichiarazioni sulla sicurezza di ricercatori AI e il dibattito sulla necessità di rallentare intenzionalmente lo sviluppo di frontiera. Più che notizie tecniche, sono notizie di governance. Non è più una questione confinata ai laboratori: si collega subito a impiego militare, attacchi informatici, dati di addestramento e antitrust.
Verso la fine del mese, gli annunci di Claude Opus 5.5 e GPT-6 Sol/Luna hanno chiarito il cambio di asse della competizione. Naturalmente si è parlato anche di prestazioni, ma ancora di più di «quanto costa usarli» e «se riescono a portare a termine il lavoro come agenti». Secondo alcune analisi, il costo dell'inferenza sta precipitando in tempi brevi: limitarsi a presentare un modello di punta rende sempre più difficile differenziarsi.
I modelli open-weight sono cresciuti grazie all'utilità, più che al clamore
Nel settore dei LLM locali, a settembre sono ricorsi spesso nomi come DeepSeek V4.1 Flash, GLM-5.3, Kimi K3 e Qwen3.8-27B. Anche senza annunci spettacolari quanto quelli dei modelli chiusi, hanno una presenza importante per efficienza dei costi, utilizzo locale e uso degli strumenti.
L'aspetto più significativo è stato il passaggio dall'idea di «possedere il modello dalle prestazioni massime» a quella di «quanto velocemente, a lungo e stabilmente riesco a farlo girare sulla mia GPU». Nella comunità locale dei LLM su Reddit, anche l'aumento dei prezzi delle GPU e delle macchine dedicate è stato un tema rilevante: il costo dell'hardware è direttamente legato alla scelta del modello.
D'altra parte, le notizie dal mondo open sono ricche anche di indiscrezioni. Nei report di fine settembre è comparso Qwen4-27B, ma nelle verifiche effettuate per questo articolo non sono riuscito a trovare una pagina ufficiale di distribuzione o una model card di Qwen. Perciò lo considero un modello che potrebbe arrivare prossimamente, non un modello consigliato da installare subito su una 4090.
Anche DeepSeek V4.1 Flash è estremamente potente. La model card ufficiale indica licenza MIT, fino a un milione di token e numerose valutazioni dedicate agli agenti di programmazione. Tuttavia, il numero totale di parametri è enorme: non è una scelta che permetta di caricare l'intero modello su una singola RTX 4090. Riuscire ad «avviarlo» tramite offload su CPU e usarlo comodamente ogni giorno per programmare sono due cose diverse.
Il LLM per la programmazione più pratico su una 4090 è Qwen3.8-27B
La RTX 4090 dispone di 24 GB di VRAM. Considerando insieme qualità del modello, velocità, lunghezza del contesto e facilità di installazione, la configurazione più equilibrata è usare Qwen3.8-27B quantizzato a 4 bit.
Qwen3.8-27B è un modello pubblico con licenza Apache 2.0; la sua card ufficiale riporta le seguenti prestazioni di programmazione.
- Terminal Bench 2.1: 73.0
- SWE-bench Pro: 61.7
- NL2Repo-Bench: 42.3
- DeepSWE 1.1: 42.2
- QwenSWEBench: 79.0
- LiveCodeBench v6: 90.3
I valori dipendono dall'ambiente di esecuzione e dall'harness dell'agente, quindi è bene evitare confronti semplicistici con altri modelli. Resta però molto importante che il modello ottenga buoni risultati non solo nel completamento di codice isolato, ma anche in valutazioni che presuppongono operazioni nel terminale e modifiche a livello di repository. Le informazioni ufficiali sono disponibili nella model card di Qwen3.8-27B.
Su una 4090, anziché caricare direttamente la versione BF16, è realistico scegliere una quantizzazione GGUF come Q4_K_M o UD-Q4_K_XL. Esiste una distribuzione di UD-Q4_K_XL da circa 17,9 GB, nonché un esempio pubblico di implementazione e misurazioni che dimostra l'uso di un contesto da 128K, input immagini e decoding speculativo entro i 24 GB di una 4090.
Non occorre però puntare subito a 128K. Per la programmazione quotidiana, consiglio di iniziare con circa 32K. Anche la cache KV consuma VRAM: estendere troppo il contesto penalizza velocità e stabilità. Invece di inserire un intero repository nel prompt, è generalmente più efficace passare solo i file necessari tramite ricerca o RAG, migliorando anche la precisione delle risposte.
Configurazione consigliata concreta
Se privilegiate la semplicità, LM Studio o Ollama sono una buona scelta; per una configurazione più precisa, è preferibile un runtime moderno basato su llama.cpp. Potete iniziare senza problemi con Qwen3.8-27B quantizzato a 4 bit, un contesto iniziale di 32K e l'offload sulla GPU del maggior numero possibile di layer.
In termini d'uso, il modello esprime meglio il suo potenziale collegandolo non a una semplice chat, ma a un agente di programmazione come Aider o Continue, oppure a uno che accetti un'API compatibile con OpenAI. Prompt che esplicitano il flusso di lavoro, ad esempio «prima delle modifiche controlla file e test pertinenti», «mantieni le differenze minime» e «alla fine riporta i risultati dei test», rendono il comportamento più stabile.
Se volete ridurre il più possibile il calo di qualità dovuto alla quantizzazione, anche le varianti Q5 sono candidate valide, ma con 24 GB lasciano meno margine per il contesto. Nella pratica, spesso è più agevole usare Q4 e mantenere spazio disponibile per contesto e cache.
In una frase, come riassumere il panorama dei LLM locali di settembre?
È stato un mese in cui l'interesse è passato da «qual è il modello più intelligente?» a «nel mio ambiente, a quale costo e quanto lavoro riesce davvero a completare?».
I modelli chiusi restano all'avanguardia, ma devono affrontare concorrenza sui prezzi e problemi di sicurezza. Il mondo open-weight non si è limitato a scontrarsi sui numeri dei modelli giganti: ha iniziato a puntare su modelli da circa 27B eseguibili velocemente su GPU personali e integrabili in agenti e flussi di sviluppo reali.
Se avete una RTX 4090, oggi iniziare dalla versione a 4 bit di Qwen3.8-27B è la scelta più sicura. Il quadro potrebbe cambiare se Qwen4-27B venisse rilasciato ufficialmente o arrivasse una versione compatta della serie DeepSeek V4.1. Ma se volete «installarlo stasera e fargli scrivere codice da domani», Qwen3.8-27B è attualmente la soluzione più concreta.
※Questo articolo è basato sulle informazioni pubbliche disponibili al 25 settembre 2026 e sui report giornalieri del sito dal 3 al 25 settembre. I valori dei benchmark dei modelli includono dati ufficiali; velocità e accuratezza in ambienti reali variano in base al metodo di quantizzazione, al runtime, alla lunghezza del contesto e alla configurazione dell'agente.



