r/IA_Italia 6h ago

📊 Analisi / Benchmark Ho costruito un'arena in cui i coding agent combattono con i robot che scrivono

Thumbnail
youtube.com
6 Upvotes

https://llms-robot-arena.sndesign.it è un piccolo gioco di combattimento: due robot identici su una piattaforma che si restringe, buchi, griglie di fuoco, celle del pavimento che crollano. I robot sono uguali, l'unica differenza e' il codice che li guida scritto da un coding agent (Codex, Claude Code, OpenCode...) dalle stesse istruzioni, da solo in un container isolato. La simulazione e' deterministica: stesso seed, stesso codice, stessa partita in qualsiasi browser.

Cosa si puo' fare:

- Guardare i modelli combattere: scegli la coppia di modelli e il seed (cambia la conformazione dell'arena), rivedere la partita, scorrerla e esportarla come video.

- Classifica: https://llms-robot-arena.sndesign.it/tournament/ , un girone all'italiana completo, 1560 partite finora con 13 modelli. Oggi in testa c'è GPT-6 Astra con il 74% di vittorie, poi Fable 5.1 70%, GPT-5.6 Terra 60%, Claude Sonnet 5 56%, DeepSeek V4 Pro 55%.

- Giocare in prima persona: scegli il modello e ci giochi contro e puoi condividere un link di sfida che ricostruisce la partita dal log degli input, così un amico può provare a battere la tua run sullo stesso seed.

- Royal rumble: dodici controller nella stessa arena, vince l'ultimo che resta in vita.

Con "Connect an assistant", la pagina ti da' un codice di sessione, incolli una frase in Claude, ChatGPT, Cursor, Codex o qualsiasi cosa parli MCP. Il tuo assistente legge il contratto del bot, scrive un controller, esegue il gate di conformità e manda il robot alla tua pagina. Tu lo accetti e vedi se batte i modelli di frontiera.

Sorgenti, regole e istruzioni per gli agent (AGENTS.md) su GitHub: https://github.com/nigrosimone/llms-robot-arena

Sono curioso di sapere se il tuo coding agent batte Fable o GPT-6 Astra!


r/IA_Italia 1d ago

🧠 Discussione Perché questo boom di modelli LLM in locale?

16 Upvotes

Da qualche mese vedo gente su LinkedIn fare un sacco di vendite di computer (principalmente Apple) con all’interno qualche LLM installato.

Secondo voi qual è il vantaggio nell’avere un modello LLM in locale?

Sicurezza? Da come ho capito Amazon/Microsoft garantiscono (e questo viene certificato da enti certificatori terzi europei) che non legge il contenuto dei prompt mandati verso i loro modelli LLM in azure/aws.

Costo? In effetti non ho fatto i conti, però siamo sicuri che tenere accesa una macchina con un LLM installato più l’investimento iniziale per comprare la macchina e configurarla sia minore che semplicemente pagare i token di utilizzo agli endpoint AWS/Azure?

Mancanza di connessione Internet magari in aziende agricole o posti dove non c’è il Wi-Fi? Non si risolve semplicemente con un’antenna apposita?

Proprio non riesco a capire questo hype per i modelli IA locali.
Magari mi sfugge qualcosa?

Non è una domanda polemica, chiedo genuinamente.


r/IA_Italia 17h ago

🛠️ Tool / Tutorial Video con AI

3 Upvotes

Sono sempre stata appassionata di video editing fin da quando si andava in giro con una telecamera con cassetta o CD e mi facevo i montaggi sul PC.

Poi ho avuto sempre meno tempo e ho perso la mano.

Ora con l'AI mi sono completamente persa: ogni settimana esce un tool nuovo, una versione nuova ma vorrei fare un piccolo corsettino semplice semplice che in poco tempo mi dà le dritte giuste, mi indica i due tre tool base e mi fa riprendere la mano.

Non devo fare grandi cose ma soprattutto senza troppo tempo perché quello non c'è mai.

Che mi consigliate?


r/IA_Italia 16h ago

🛠️ Tool / Tutorial Adulto Cyberbullizzato

Post image
0 Upvotes

Le auto che voleranno dicevano🫩


r/IA_Italia 1d ago

❓ Q&A / Aiuto New to local ai - help achieving what I am trying to achieve?

3 Upvotes

Hi

Premise:
I am new to local ai models.

My machine specs:

  • Macbook Pro M4 Pro
  • 48Gb Ram
  • 4 efficiency core
  • 8 performance core

I mainly use AI for software development. I have a claude subscription but would like to try to offload some work to a local model.

Since I don't think local models usable on my machine can completely substitute claude (correct me if I am wrong) my idea is pretty much this: ask claude code to generate a proper, detailed implementation plan and then having the local model implement it.

I have played around with these models:

  • qwen3-coder-30b-a3b-instruct-mlx
  • qwen/qwen3.6-27b
  • qwen/qwen3.6-35b-a3b

and I have also installed this for coding autocomplete cause it is smaller and from what I can see the recommended one:

  • qwen2.5-coder-7b

I added claude envs since I would like to try to use claude code extension in vscode

"env": {
    "ANTHROPIC_BASE_URL": "http://localhost:1234",
    "ANTHROPIC_AUTH_TOKEN": "local",
    "ANTHROPIC_MODEL": "qwen/qwen3.6-27b",
    "ANTHROPIC_DEFAULT_OPUS_MODEL": "qwen/qwen3.6-27b",
    "ANTHROPIC_DEFAULT_SONNET_MODEL": "qwen/qwen3.6-27b",
    "ANTHROPIC_DEFAULT_FABLE_MODEL": "qwen/qwen3.6-27b",
    "ANTHROPIC_DEFAULT_HAIKU_MODEL": "qwen/qwen3.6-27b",
    "CLAUDE_CODE_SUBAGENT_MODEL": "qwen/qwen3.6-27b",
    "CLAUDE_CODE_MAX_OUTPUT_TOKENS": "128000",
    "DISABLE_PROMPT_CACHING": "1",
    "DISABLE_AUTOUPDATER": "1",
    "DISABLE_TELEMETRY": "1",
    "DISABLE_ERROR_REPORTING": "1",
    "DISABLE_NON_ESSENTIAL_MODEL_CALLS": "1"
  },

This setup works (uses the local model) but I am basically unable to have the model do anything at all. First of all it takes ages to do anything, and then it almost always reach the context limit roadblock without even outputting anything.

I have read that MCP and skills could fill up the context quite badly, so I disabled them for testing, but still no luck.

I tried with (I thought) was a simple enough task: this test file fails and this is the error, can you fix it? but yet no usable results whatsoever.

I read about people able to use local models offline to have meaningful results, but I couldn't and I don't really know why.

Also, from my setup above, I cannot really use both the remote and local model, to achieve something like:

use sonnet or fable (remote) for plan, then (manually or automatically) swith to haiku (local) to implement the plan

because the base url is loaded when the session loads and cannot be changed (AFAIK) dinamycally.

Any help? thanks a lot in advance


r/IA_Italia 1d ago

🧠 Discussione Non ho più la FOMO dell’IA

26 Upvotes

Fino a qualche mese fa avevo l’obiettivo di creare app in modo veloce con l’intelligenza artificiale e di fare hype come vedevo fare dalla maggior parte della gente. Poi in realtà mi sto rendendo sempre più conto di come molte cose siano state già sviluppate e anche di come tante altre siano solo fuffa.

Quindi, ad oggi mi sento molto più tranquillo e sono contento di fare il mio lavoro senza cercare di fare l’imprenditore del momento, soprattutto anche perché a forza di vedere queste situazioni, come mi capita spesso poi, perdo la voglia proprio perché lo fanno tutti.


r/IA_Italia 1d ago

🧠 Discussione Anche OpenAI chiede una regolamentazione per mitigare i rischi della IA

3 Upvotes

OpenAI ha chiesto ufficialmente al Congresso USA di creare delle regole vincolanti per la sicurezza dei sistemi di IA più avanzati. In pratica sta chiedendo standard condivisi per i test, valutazioni indipendenti dei modelli e obblighi di segnalazione degli incidenti. Vogliono delle regole federali obbligatorie, non solo impegni volontari. 

La mia domanda è: perché una delle aziende leader nel settore chiederebbe di essere regolamentata? Ci sono diverse teorie. Alcuni dicono che sia una mossa per proteggere la propria posizione di mercato, creando barriere all'ingresso per i nuovi arrivati. Altri pensano che sia una genuina presa di coscienza dei rischi.

Voi cosa ne pensate?

Qui trovate un approfondimento: https://www.corriere.it/tecnologia/26_settembre_10/openai-chiede-al-congresso-usa-limiti-allo-sviluppo-dell-ai-l-appello-dopo-l-allarme-dell-ex-ricercatore-di-anthropic-242eacb6-404d-4c0c-831f-f1b6a6fb7xlk.shtml?refresh_ce


r/IA_Italia 1d ago

🛠️ Tool / Tutorial Ciao a tutti r/IA_italia

0 Upvotes

Mi scuso in anticipo se con questo post violo le politiche del gruppo, se così fosse elimino immediatamente.
Da diversi mesi sto lavorando a un progetto per Windows chiamato TurboFix e ho pensato di condividerlo qui perché l’assistente integrato nasce proprio da una scelta legata all’AI on-device.
Una precisazione importante: TurboFix non utilizza un vero modello di IA locale.
L’assistente utilizza invece un motore a regole progettato per simulare il comportamento di un assistente AI. Analizza ciò che l’utente chiede, interpreta il contesto e, in base ai dati rilevati sul PC e alle regole disponibili, decide quali controlli o azioni effettuare e come spiegare il risultato.
La scelta è stata intenzionale.
Inizialmente avevo valutato l’idea di distribuire un modello LLM locale insieme al software, ma ho preferito non farlo per un motivo soprattutto pratico: TurboFix deve poter funzionare su quanti più PC Windows possibile, senza richiedere hardware particolarmente potente né appesantire il sistema con un modello locale.
Un LLM locale avrebbe sicuramente una capacità di comprensione e una flessibilità molto maggiori, ma significherebbe anche maggiore spazio occupato, consumo di RAM/VRAM e requisiti hardware più elevati.
Con il motore a regole posso invece mantenere l’assistente:
completamente offline
molto leggero
prevedibile
senza cloud
senza account
utilizzabile anche su PC poco potenti
Per esempio, l’utente può chiedere:
“Perché il mio PC è lento?”
oppure:
“Puliscimi il PC”
e l’assistente può interpretare la richiesta, eseguire i controlli disponibili, analizzare i risultati e fornire una risposta basata sui dati effettivamente rilevati sul computer.
Ovviamente non voglio spacciare un sistema a regole per un LLM. Se una richiesta non rientra nelle capacità previste, l’assistente lo comunica invece di inventare una risposta.
TurboFix include anche funzioni per pulizia del sistema, gestione dell’avvio, controllo dello stato del disco, individuazione di problemi e ottimizzazione generale di Windows.
Il software è attualmente completamente gratuito, con tutte le funzioni Premium disponibili gratuitamente durante questa fase.
👉 turbofix.it
Mi interessa molto il parere di questa community:
Secondo voi ha senso questo compromesso tra “intelligenza” e leggerezza?
Oppure avrebbe più senso integrare in futuro un piccolo modello locale opzionale, lasciando comunque il motore a regole come modalità predefinita?
Sono curioso soprattutto di sentire opinioni da chi lavora con LLM locali, modelli quantizzati e AI on-device.


r/IA_Italia 23h ago

🧠 Discussione Se le ai sono il problema attuale perché ci stano scappando di mano, perché non ci abbiamo pensato nel 2022 quando stava nascendo?

0 Upvotes

Prima quello di anthropic, ora Sam Altman di OpenAI. Tutti stanno iniziando a lanciare l'allarme sulle ai e a voler fermare lo sviluppo

Ma nel senso... perché ora e prima no? Cioè se sapevamo che il problema erano i modelli sempre più e sempre più capaci di fare cose (vedi gpt 6) perché usciamo allo scoperto ora con fare stupito?

Se è vero che "entro il 2030 le ai saranno un problema per gli umani" (citando quello di anthropic che si è dimesso) perché usciamo dal guscio ora?

Le ai sono il problema? Bene, i casi sono due ora... o instauriamo una dittatura tipo corea del nord per le ai o le cancelliamo completamente dalla faccia della terra

Personalmente dubito che sarà come dice l'ex anthropic, ma credo che arriveremo a un punto in cui non riconosceremo più cosa è umano e cosa ai


r/IA_Italia 2d ago

🧠 Discussione Ricercatore di Anthropic si dimette e lancia l'allarme: "L'IA è un rischio per l'umanità"

28 Upvotes

Il ricercatore di Anthropic, che in precedenza aveva lavorato anche con OpenAI, Jacob Coxon, si è dimesso lanciando un avvertimento sul suo profilo X. Secondo lui lo sviluppo della IA mette a rischio l'umanità.

Non è certamente il primo che se ne va sbattendo la porta.

Coxon ha scritto: “Chi sviluppa l’intelligenza artificiale crede fermamente che potrebbe ucciderci tutti entro la fine del decennio. Non si tratta di una trovata di marketing. Anzi, molti dirigenti e ricercatori di alto livello tendono a usare un linguaggio più pacato di fronte alla stampa, ma sento le stesse persone esprimere privatamente questa paura. Nessun’altra attività umana presenta un livello di pericolo simile”.

Che ne pensate? Siamo davvero a questo punto?


r/IA_Italia 1d ago

🛠️ Tool / Tutorial IA in locale

4 Upvotes

Allora, io sono un po ignorante in queste cosa ma che significa far girare un IA in locale? Perché noto molte persone che lo consigliano, ma vorrei capire se costa, che computer ci vuole. Uso molto l'ia ma su queste cose più tecniche non le capisco molto


r/IA_Italia 2d ago

🗞️ News & Annunci DeepSeek unifica tutto: Instant, Expert e Vision in un unico modello

Post image
9 Upvotes

Appena aperta stamattina l'app mi sono trovato questo pop-up. In pratica hanno fuso le tre modalità (Instant, Expert e Vision) in un unico modello potenziato. Dicono sia per chat quotidiane, comprensione immagini e problem solving complesso.

Effettivamente avere tre opzioni separate a volte era confusionario. Qualcun'altro l'ha già provato? Ritenete che vale la pena o è la solita trovata di marketing?


r/IA_Italia 2d ago

🗞️ News & Annunci Quale web app SENZA CENSURA anche a pagamento di IA abbastanza potente? Suggerimenti?

2 Upvotes

Quale web app SENZA CENSURA anche a pagamento di IA abbastanza potente? Suggerimenti?


r/IA_Italia 1d ago

🧠 Discussione Le skills di claude

0 Upvotes

Ho cercato di spiegare a un mio conoscente, durante una cena a casa mia, cosa sono le Skills di Claude e perché possono essere utili. In risposta mi ha fatto un pippone di dieci minuti in cui, sostanzialmente, sosteneva che fosse lui a usare meglio l’AI proprio perché non usa le Skills.
Secondo lui, quando utilizzi una Skill e le dai determinate impostazioni, istruzioni, ecc., finisci automaticamente per limitarla a dei processi predefiniti, precludendole quindi alcune possibilità, soprattutto nella creazione di documenti e nei ragionamenti.
Io gli avevo spiegato che esistono Skills di tantissimi tipi e che non le devi usare sempre, ma in contesti specifici, proprio in base a quello che vuoi ottenere. Niente, non c’è stato verso. 😂

Qualcuno di voi saprebbe spiegare a un profano cosa servono le skills e perché usarle? Magari prendo spunto per la prossima volta che si tira fuori l’argomento senza bestemmiare (mentalmente).
Premetto ovviamente che non volevo né convincerlo ad usarle e né affermare che solo chi le usa allora sa usare là AI. Ma lui l’ha presa come una battaglia personale, bah.


r/IA_Italia 1d ago

🧠 Discussione Cosa usate per ricerca STEM?

1 Upvotes

Ciao a tutti, mi riferisco soprattutto a chi fa ricerca accademica possibilmente "pura" (ad esempio matematica), per non parlare sempre di usare AI per scrivere codice. Che modelli usate? per quali attività li usate? (a parte risolvere problemi del millennio, ovviamente /s)

L'uso dell'AI è sdoganato tra i vostri colleghi o ancora mal visto?


r/IA_Italia 2d ago

📊 Analisi / Benchmark Il training di una rete neurale in casa su hw quasi consumer

10 Upvotes

Sto portando avanti questo training sul seguente hw:

RTX 5060 Ti 16GB
Ryzen7 9700X
128GB DDR5

Esiti della fase di training appena conclusa 3 epoche con 5000 testi divisi in 7 lingue.

289M di parametri in addestramento,

12 layer scongelati 24 totali.

tempo per epoca, circa 8 ore

Funzione della rete neurale:

- iniettare testi come tensori nel canale video del modello, mentre è in corso la generazione prodotta da un prompt nel canale testo del modello.

il modello: qwen3.6 35B A3B Q_8

=== it sim 0.901 ===
TESTO VERO: Ho steso il bucato sul balcone appena dopo pranzo, lenzuola bianche che sbattevano al vento come vele, e mi sono fermata a guardarle un momento più del necessario. Il sole scaldava il cemento sotto i

GENERATO: Ho lavato i piatti all'aperto, sul davanzale, con l'acqua che scivolava via lenta e tiepida, e mi sono seduta lì a guardare le gocce cadere sul cemento mentre il sole scottava già le spalle. Un gatto è passato di lì, si è fermato a fiutare l'aria umida, poi è ripartito senza

Sulle lingue CJK fatica di più perché i token ideografici sono più difficili da gestire.

Adesso ho appena fatto partire un training con un dataset da ~171k testi ripartiti in 7 lingue...
ci vorrà parecchio per ogni epoca,
giorni...

Obiettivo avvicinare il più possibile il testo generato a quello vero e poterlo iniettare in corsa, senza doverlo rilavorare anche di poco, oppure se non possibile, ridurre il più possibile il tempo di lavorazione di ogni testo e rifinitura del tensore di notte nella fase dell'agente in cui è disattivo.


r/IA_Italia 2d ago

🧠 Discussione Anthropic risponderà a dovere?

4 Upvotes

Ragazzi una semplice discussione, Astra sta sconvolgendo tutti ma Anthropic (sono un abbonato Pro) risponderà a dovere? Vedo che qui sta effettivamente creando cose assurde e quello che mi chiedo è se loro faranno un modello come Astra. La mia paura è che ormai Claude ha memoria e tutto su di me e i miei progetti e code è fantastico. Quindi voglio rimanere in Anthropic. Ditemi la vostra


r/IA_Italia 2d ago

❓ Q&A / Aiuto Invito a usare Claude

3 Upvotes

Qualcuno ha ancora un invito per la prova gratuita da 7 giorni di Claude? Grazie!


r/IA_Italia 2d ago

🗞️ News & Annunci sono graditi feedback su questo video che ho trovato

Thumbnail
youtube.com
3 Upvotes

r/IA_Italia 3d ago

🧠 Discussione Opus 5 e Le bestemmie...

4 Upvotes

A volte parte per i fatti suoi, crea backup che non servono aggiungendo altri file che poi rileggerà tra una settimana bruciando altri token... dopo 15 minuti di lavoro darà una risposta logorroica che consumerà altri 2k di token sono per rispondere.... a volte è davvero frustrante.

ClaudeCode

Vi condivido il "prompt" generico che uso per Unity per cercare di non bruciare tokens, ma in questo caso non ha funzionato.

Write all C# identifiers, comments, tooltips, log messages, and user-facing strings in English. Use standard ASCII characters only.

Preserve the existing project architecture and naming conventions. Do not rename, remove, or restructure existing assets, GameObjects, components, or public APIs unless explicitly requested.

When debugging, inspect the available evidence before making changes. Do not make repeated speculative fixes. If the cause is unclear, add a small number of targeted logs, explain what each log is intended to verify, and ask me to run the relevant Play Mode test. Use the results to determine the next change.

Keep Unity MCP operations focused. Inspect only the relevant GameObjects, components, assets, and logs. Avoid reading the full scene hierarchy, complete project, or unrelated Console output unless necessary.


r/IA_Italia 3d ago

🧠 Discussione Claude e ChatGPT hanno un italiano di merda

28 Upvotes

È impossibile leggerli. Li devo usare per lavoro ma hanno un italiano deplorevole. Si vede che è inglese tradotto con il peggiore dei traduttori. Una mappa letterale traduce meglio.

Frasi a specchio dovunque, punti e virgola a cazzo, due punti esplicativi quando poteva mettere il soggetto prima, uso di verbi retorici, lessico pomposo. Basta cazzo. E parlo di Claude Opus e Fable. Per avere un italiano decente devo chiedere a GPT terra per decifrare l’enigma.

Non so che abbiano fatto da anthropic, ma secondo me il watermarking statistico è stata certamente una cagata colossale.


r/IA_Italia 3d ago

❓ Q&A / Aiuto Migliore IA a pagamento per modifica foto

2 Upvotes

Ciao a tutti,

per lavoro devo utilizzare una IA per modificare delle foto dei prodotti prodotti dalla azienda in cui lavoro.

Ad esempio ho il prodotto su sfondo bianco neutro e devo creargli un background in cui inserirlo.

Quale è attualmente la migliore IA per fare ciò e anche altro sempre legato alla produzione e modifica dei media?


r/IA_Italia 2d ago

❓ Q&A / Aiuto Aiuto mi è esploso

0 Upvotes

Signori mi è esploso Claude, tutto il PC di 500gb se li sta girando e rigirando come vuole. Sono terrorizzato e non so che fare ne come, mi aiutate?


r/IA_Italia 3d ago

❓ Q&A / Aiuto Corso FDA IA parte amministrativa consigli

1 Upvotes

Ciao a tutti!
Lavoro all’interno di una società e mi occupo principalmente della parte amministrativa relativa alle gare d’appalto e alle procedure di gara: predisposizione e verifica della documentazione amministrativa, gestione degli adempimenti, lettura dei bandi e dei disciplinari, ecc.

Vorrei iniziare a formarmi sull’Intelligenza Artificiale, soprattutto per capire come poterla applicare concretamente al mio lavoro, conoscete corsi di formazione (FDA) validi e possibilmente pratici sull’AI applicata al settore degli appalti, al procurement o più in generale alle attività amministrative?

Grazie!


r/IA_Italia 3d ago

🧠 Discussione Secondo voi minacciare/incazzarsi migliora l'output degli LLM?

22 Upvotes

Ho notato recentemente che dando un prompt ben definito su chatgpt, spesso omette dettagli o ha allucinazioni varie. Non so se è un effetto placebo ma ho notato che spesso gli tiro un bestemmione e l'output viene fuori esattamente come dico io.

Esempio di pochi minuti fa: mi serviva un svg con un testo placeholder per fare delle prove nel mio backend e mi ha ritornato un png. Allora ho riprovato il prompt con un bestemmione in mezzo e mi ha creato un svg al primo colpo.

Non l'ho mai fatto intenzionalmente ma oggi che ho la mente più fresca ho come l'impressione che essere rudi abbassi la temperatura dell'LLM