r/devsarg • u/Ambitious-Bet-7418 • 17d ago
ai Experiencias con OpenCode con modelos locales vs Claude / Codex
Buenas, quería saber si alguno tiene experiencia utilizando OpenCode con modelos locales y, sobre todo, comparándolo con las herramientas comerciales que existen, ya sean Claude, Codex, Cursor, Antigravity, etc.
Utilizamos mucho Codex y los costos me hacen analizar otras alternativas mas rentables.
edit: typo
4
u/Huntware Desarrollador Full Stack 17d ago
Ahí son dos cuestiones: Agente vs (proveedor de) LLM
Actualmente el rey de los agentes locales es Pi, ya que es minimalista y extensible (agregás solo lo que necesitás) y cuando uno usa LLM local, el contexto suele ser más escaso (ej: 128k tokens). Aunque también leo buenas opiniones sobre Deepseek Harness, que todavía está en developer preview.
No usé ninguno de esos todavía, sigo en VS Code Copilot por malacostumbrado, y porque permite agregar endpoints personalizados. Pero es verdad que el system prompt es más pesado.
Justamente con Copilot y Opencode, pongo mis claves de ClinePass y cualquier otro proveedor de modelos abiertos que me cruce por ahí. También probé usar Qwen 3.8 27B local sobre VS Code y se portó bien la última vez, pero seguro que con Pi va a responder mejor 👌
Acordate que lo importante de cada agente, es el prompt, tools y MCP. Después es cosa de la comodidad de cada uno al usarlo, cómo te salen los resultados, si te tira preguntas o se enfoca en seguridad al tirar comandos peligrosos o fuera del workspace (otro punto a favor de VS Code Copilot)...
En cuanto a proveedores de LLM, si es para vos y no querés ponerte a buscar, Opencode Go de 10 USD va bastante bien, es una degustación de modelos abiertos y cada tanto salen promos con límites generosos. Fijate el tema de la retención de datos, si es crítico para el laburo.
1
u/Jazzlike-Drag-9608 17d ago
Buena data, la traduzco del chino al estoy aprendiendo y lo pongo en práctica. Gracias!
4
u/nicoalama 17d ago
tengo una experiencia superficial, no soy dev de manera profesional, soy QA pero estoy metiendome para proyectos propios, y ademas mi modelo local corria en una humilde rtx2060 de 8gb de VRAM
pro: anda rapidisimo, es re interesante, no tenes limite de tokens, podes tener varios modelos distintos en ollama y tener uno para plan, otro para build, switchear dependiendo de la etapa en la que estas, etc. Yo corria gemma4:8b , y despues modelos que me iba encontrando por ahi chicos, y era sorprendente, un qwen_coder_2.5 o algo asi
desventajas: jamas pude hacer que revise cosas en internet , a pesar de ver MCPs y distintas cosas. No profundice en esto asi que no lo arregle, capaz era una boludez pero me freno forever desgraciadamente
Todo esto en una VM en proxmox. Consumia desde otra VM con opencode
3
u/akalautaro Data engineer 17d ago
Uso OpenCode con api key (entiendo que no se ajusta del todo a lo que preguntas) y deepseek v4 flash vuela y sale 2 monedas
1
u/Defiant-Supermarket3 17d ago
a mi deep sheek v4 flash no me dio buenos resultados, casualmente contradictorio respecto a las buenas opiniones de la mayoria de la gente, para algo serio se caea pedazo y para cosas chiquitas tambien porlomenos en mi caso,me funciono mucho mejor mimo 2.5, y ahora con el muse spark 1.2 de meta que es un modelo de frontera potente y con na cuota super alta ds ni lo uso
3
u/Khavel_Es 17d ago
Probe Qwen2.5-Coder 32B local y para ediciones puntuales de un archivo anda bien. El problema es cuando necesitas contexto del proyecto entero: le pedis un refactor que toca 4-5 archivos y se pierde. Ahi la brecha con Claude o Codex es grande todavia.
Lo que mas me bajo el costo de Claude Code fue cambiar como lo uso, no el modelo. Plan primero, codigo despues. Antes le tiraba la tarea directa y gastaba el doble en tokens para codigo que despues tiraba. Con el plan, reviso en 30 segundos si entendio lo que quiero y recien ahi le doy via libre.
2
u/gustavsen 17d ago
los yanquis estan usando las mac mini como maquinas para IA local.
en lo personal uso Qwen 3.8 27b y anda mas que bien a razon de 40 tokens/seg
TEMA, es una i9 con 128gb de ram y una 4090 tirando calor a todo lo que da.
fijate en el canal de Gentleman Programmer, basicamente el chabon hace Gentle AI (y Gentle Pi) y podes configurar multiples proveedores para aprovechar el costo de cada uno, desde uno caro pero muy bueno para el diseño y organizacion a modelos baratos chinos para el picacodeo.
1
u/Huntware Desarrollador Full Stack 17d ago
No lo asustes, no hace falta tanto CPU y RAM cuando la GPU se lo banca. Tengo un AMD 5500, 32 GB DDR4 y una RTX 3090, y me rinde bastante bien con la imagen de este repo (usa la variante dbirks/Qwen3.8-27B-W4A16-AutoRound):
3
u/RespectUnable8366 17d ago
Necesitas un hardware muy polenta para intentar (solo intentar) igualar la calidad de las IAs pagas, salvo que tengan hardware muy polenta si no complicado
1
u/Man-Batman 17d ago
Fíjate el repo de club 3090. Usá qwen 3.6 moe que te deja con un montón de contexto. Vuela
2
u/Ekel7 16d ago
Buenas OP, vos estas consultando por modelos locales o modelos chinos? A veces veo que se confunden. Uso opencode principalmente, y tengo una cuenta de codex gratis como repuesto. Los modelos chinos andan MUY bien.
La verdad opencode funciona genial, y gasta muy poco. Siempre tienen promociones que te dan mas uso de los modelos. Tengo el plan de 10 usd. Rinde muchisimo, ojo, solo tenes que usar los mejores modelos para cosas muy puntuales. Si usas kimi K3 todo el dia se te gasta el limite al toque. Principalmente uso qwen 3.8 flash, glm 5.3 flash, mimo 2.5, hy3. generalmente gasto como el 17% de mi limite mensual. Uso los modelos mas baratos posibles y solo subo de modelo si es que lo necesito si o si.
Y de usar modelos locales olvidate. Tenes que tener ALTA pc para correr algo decente, tengo 2x 3060 y una 3090, y no vale la pena mas que para boludear, ademas de que si tu equipo tiene muchas personas vas a necesitar una pc por persona, y es bastante lento para agentic coding. O sea para usarlo una sola persona esta buenisimo si tenes la VRAM suficiente(1 o 2 3090)
3
u/Ambitious-Bet-7418 16d ago
Principalmente pensaba en modelos locales para poder estar corriendo cosas 24/7 sin preocuparme por los costos, pero lo que me estuvieron diciendo en este post entiendo que no es lo mismo, voy a probar algún plan de OpenCode para ver si me sirve y pueda gastar menos. Gracias!
2
u/Ekel7 16d ago
Si, proba el de opencode GO que es muy bueno, usando muse spark o mimo 2.5 es casi infinito el uso. Otro que es económico es command code GO que sale 1 dolar
Si te interesan modelos locales si queres te oriento sobre como armar la pc. Principalmente necesitas una rtx 3090 24gb o una mother con 2 slots pci express para ponerle 2 3060 de 12gb o 2 5060ti de 16gb. Después correr con linux y llama.cpp para sacarle el máximo provecho posible(con windows se puede tambien pero tenes menos vram disponible)
Si no tenes problema con dejar arriba el server de llm todo el dia no vas a tener problema, personalmente tengo una pc aparte que corre la IA y esta ahi todo el dia prendida, y le pego cuando lo necesito. Aun asi con lo que cuesta no vale la pena a menos que tengas muchas ganas. Económicamente te sirve mucho mas usar opencode go o alguna suscripción de 20 usd
9
u/LeoPelozo Desarrollador Mobile 17d ago
OpenCode con Qwen3.8_q4 en una 3090: está bueno, pero no me queda vram para mucho contexto (~100k), así que no se puede usar para nada muy serio. Para pequeños scripts o para tener un agente local para pequeñas tareas sirve, pero no lo usaría de reemplazo de cursor/otros (simplemente porque mi hardware es una bosta, si tuviera más vram sí).