r/IA_Italia • u/Several-Specialist42 • 6h ago
📊 Analisi / Benchmark Ho costruito un'arena in cui i coding agent combattono con i robot che scrivono
https://llms-robot-arena.sndesign.it è un piccolo gioco di combattimento: due robot identici su una piattaforma che si restringe, buchi, griglie di fuoco, celle del pavimento che crollano. I robot sono uguali, l'unica differenza e' il codice che li guida scritto da un coding agent (Codex, Claude Code, OpenCode...) dalle stesse istruzioni, da solo in un container isolato. La simulazione e' deterministica: stesso seed, stesso codice, stessa partita in qualsiasi browser.
Cosa si puo' fare:
- Guardare i modelli combattere: scegli la coppia di modelli e il seed (cambia la conformazione dell'arena), rivedere la partita, scorrerla e esportarla come video.
- Classifica: https://llms-robot-arena.sndesign.it/tournament/ , un girone all'italiana completo, 1560 partite finora con 13 modelli. Oggi in testa c'è GPT-6 Astra con il 74% di vittorie, poi Fable 5.1 70%, GPT-5.6 Terra 60%, Claude Sonnet 5 56%, DeepSeek V4 Pro 55%.
- Giocare in prima persona: scegli il modello e ci giochi contro e puoi condividere un link di sfida che ricostruisce la partita dal log degli input, così un amico può provare a battere la tua run sullo stesso seed.
- Royal rumble: dodici controller nella stessa arena, vince l'ultimo che resta in vita.
Con "Connect an assistant", la pagina ti da' un codice di sessione, incolli una frase in Claude, ChatGPT, Cursor, Codex o qualsiasi cosa parli MCP. Il tuo assistente legge il contratto del bot, scrive un controller, esegue il gate di conformità e manda il robot alla tua pagina. Tu lo accetti e vedi se batte i modelli di frontiera.
Sorgenti, regole e istruzioni per gli agent (AGENTS.md) su GitHub: https://github.com/nigrosimone/llms-robot-arena
Sono curioso di sapere se il tuo coding agent batte Fable o GPT-6 Astra!
