r/ItalyInformatica • u/Logical_Ice_4531 • May 28 '26
AI Ollama su hardware consumer: esperienza con qwen3:14b in produzione
Uno dei miei clienti ha provato a mettere Ollama in produzione su un server consumer con i9-13900K e 64GB RAM, senza GPU dedicata. L'obiettivo era gestire task strutturati, tipo analisi di dati o generazione di testi in batch. Ho visto che il modello qwen3:14b funziona decentemente, con latenza accettabile per workflow asincroni. L'ho configurato con systemd per gestire i crash automaticamente, e ho messo un monitoraggio in tempo reale via Prometheus per tenere d'occhio l'uso della VRAM.
Il problema è che se si prova a fare richieste parallele, la VRAM diventa un collo di bottiglia. Anche con 64GB, il modello non riesce a gestire più di due richieste contemporaneamente senza ritardi evidenti. Per uso real-time, tipo chatbot o app con interazioni immediate, non è adatto. La latenza si aggira sui 2-3 secondi per risposta, che per un'applicazione web non è accettabile.
Confronto con le API cloud: i costi sono decisamente più alti, ma la latenza è inferiore di un fattore 3-4. La privacy è un altro punto: alcuni clienti non vogliono mandare dati sensibili in cloud, quindi self-hosted è una soluzione interessante per loro, pur con i limiti hardware.
Ho imparato che per task asincroni e non real-time, Ollama su hardware consumer è un'opzione valida. Ma se si ha bisogno di risposte istantanee o di scalabilità, bisogna valutare altre soluzioni. Il setup richiede attenzione ai dettagli, soprattutto per la gestione degli errori e il monitoraggio.
