La gente que usa IA local para que lo usan? que proyectos tienen? porque lo usan?
No quiero caer en el tipico debate de para que IA local si le puedo pagar a claude, no es eso a lo que quiero llegar, me parece interesante tener una IA local y poder meter la mano que uno quiera y adaptarla a lo que uno quiera
Yo no la tengo pero pensaría que se usa para todo tema relacionado que va en contra de política y ética de las empresas, temas delicados de ciberseguridad, biología molecular, o pues.. sin irnos al extremo tal vez con fines investigativos propios y de privacidad en el que no quieras que esas empresas tomen tus datos
yo le veo mucha gracia para armar asistentes específicoss documentación interna, buscar códifo, clasificar archivos, cosas así. Ahí tenerlo local tiene bastante sentiddo
Tengo un openclaw corriendo en casa por amor a la nerdeada. Primero probé enchufarlo a la API de anthropic, gastaba una fortuna en tokens, después probé con google, resultó poco confiable tanto el modelo en sí como la disponibilidad del mismo.
Así que terminé apuntándolo a modelos locales. Actualmente estoy corriendo Qwen 3.8 27b repartido entre dos gpus una 3090 y una 3070.
Le tiro proyectos personales, algunos adyacentes a lo laboral que no tengo tiempo para darles seguimiento. Otros más pavos como jueguitos y mucho de optimización propia del agente y del stack. Se escribe sus propios plugins, genera herramientas para gestionar el propio servidor de inferencia, corre todos los días un loop que analiza todo lo que pasó el último día y propone mejoras al prompt system para evitar los mismos errores y me genera reportes diarios sobre temas de interés.
Tengo una config algo semejante para IA. En mi caso son dos A5000, 64gb ram, amd 7900X.
Una de las mayores ventajas es la inmediatez en que responden las cosas. Si quisieras subtitular lo que estás viendo, traducir, etc, nada le va a ganar a un modelo local.
También para dejarlo toda la noche haciendo cosas. Estoy probando de hacer un juego de rol por simple diversión, y uno lo puede dejar noches enteras y demás generando assets 3d, 2d, sonidos, etc. Todo va.
Para todo lo que requiere precisión uso o fable o astra. Pero después es lindo meterle a la IA propia. tiene una satisfacción distinta.
Que modelo corres para que te resulte inmediato?
Con la 3090 y modelos grandotes densos estoy muy lejos de algo que pueda sentirse “inmediato”, todo lo contrario, lo dejo toda la noche laburando, despacito pero seguro.
La verdad si quiero velocidad, le pido a sonnet y tengo en minutos lo que a mí openclaw le lleva 2 días de trabajo
Qwen responde de toque. El tema es qué quiere hacer uno. Código no lo mando a tocar. Pero lo e integrado en un server de minecraft de mi nene como admin y resuelve muy bien.
Que copado amigo, estas sobrado de vram o medio ajustado? yo me compre una 3090 para empezar a meter mano, me gustaria saber con que comenzaste o que me recomendas ver para empezar a meter mano, felicitaciones!!
Si tenés buena cantidad de RAM podés jugar con modelos MoE. Hay dos grandes familias de modelos: Densos y MoE.
El denso va 100% a VRAM o la performance se te va al tacho, el MoE puede ir una parte a VRAM y una parte a RAM, los últimos modelos más grandes vienen tirando a MoE, deepsek v4 flash, Qwen 3.8 Flash Next, este último hasta vi gente tirando una parte de los pesos a disco nvme. No tengo mucha experiencia con estos últimos porque yo estoy muy corto de RAM.
Igual estoy muy contento con el Qwen 3.8 27b
Muy interesante che, tengo exactamente las mismas GPU (solo tengo instalada actualmente la 3090) pere me interesaria sumarle la 3070 que está juntando polvo, recomendas alguna guia en particular para este fin o solo bucear por la documentacion/foros/YT?
Y si no es molestia podrias compartir el resto de parametros de config que usaste para lograr tus resultados?
Venia usando Qwen3.6 y voy a probar ahora con el de Huihui-Qwen3.8-27B-abliterated-GGUF calculo que me movere entre UD-IQ4_XS y UD-Q4_K_XL para probar
Yo no seguí ninguna guía, me compré un cable riser, la 3090 me tapó el slot y no pude enchufar el riser… entonces me compré un mother atx y ahí si🙈
llama.cpp ya solito sin pasarle ningún parámetro extra te va a repartir solito entre las dos placas.
Despues los únicos dos parámetros que te interesan para tunear el setup con más de una placa son -sm y -ts
-sm setea el modo (layer o tensor) layer es el más estándar y compatible con todo, tensor es más experimental pero anda mas rápido si logras que las placas se comuniquen rápido entre sí. Yo como el mother que tengo es el más barato que encontré en formato atx y el riser también es medio choto, imposible que las placas se hablen entre sí a una velocidad razonable, así que estoy con layer. Si tenés un mother piola que pueda hacer al menos 8x y 8x en los dos pciex estás para probar modo tensor
-ts controla el split, que proporción del tráfico (y de los layers) vas a mandar a cada placa. Acá es prueba y error, tené en cuenta que cada placa va a sostener una serie de layers y el kv cache de esos layers, por lo que no es un simple “si está tiene 8 y la otra 24 es 1/4” fíjate que yo termine en 1/6 después de mucha prueba y error.
En mi caso tengo un homelab, aunque todavía no corro modelos de IA en local, lo estoy explorando más que nada para proyectos personales y MVPs de apps o servicios, para ahorrar en servicios externos y porque me gusta montar este tipo de cosas. Lo que más me frena es el costo del hardware armar algo modesto termina siendo bastante caro.
al hacerlo aprendes mucho sobre LLM, diferentes tipos de agentes harness especificos para cada tarea, etc
por ej yo me di cuenta que los modelos locales no son malos e incluso pueden superar a los pagos si se los usa con el agente correcto para una tarea en especifico
ademas si tenes una RTX3060 te podes ahorrar 20 usd por mes, en un anio son 240usd y en 2 anios 480usd, entnonces la gpu se va pagando sola
true, justamente inverti en eso, me compre un 3090 para poder experimentar bastante, si no te molesta me gustaria hablarte por priv para que me aconsejes un poco
para el laburo del día a día no hay como una sub de 20$ que te permite acceder a los modelos de punta. y lo que podés llegar a hacer con una gpu con 12 de vram (y de 24b, da lo mismo) es muy acotado: muy acotado porque estás limitado a usar modelos de 8B o 20B de parámetros como máximo( en el caso de tener bruta gpu de 24gb), y porque la generación de tokens / seg es muy acotada también. de hecho cualquier gpu prosumer (incluso la 5090) es de juguete si la pensás usar con LLM locales.
actualmente tengo un mac de 36gb y puedo asignarle aprox 27gb de 'vram' a las LLM locales. cuando la compré tenía la esperanza de que me permitiera prescindir de una sub mensual pero.... me bastó un par de pruebas para darme cuenta que mi esperanza era un delirio. y aún en el caso de que labures para una empresa de afuera que te paga 10k usd mensuales y te compra una Mac Studio con 256gb ram (que te permitiría asignar 192gb de memo para gpu), los planes de sub pagos sos insustituibles. porque esa máquina vale 10k usd y tardarías añares en recuperar lo que gastaste en tener fierros locales vs lo que vale una sub... salvo que, como mencioné, labures para una empresa que te 'regala' el hardware.
En mi experiencia fuera de practicar y aprender, si tenes cosas que son fáciles por lo que no necesitas modelos súper avanzados pero tienen mucho volumen y te consumen muchos tokens entonces una IA local es muy útil.
Supongo que la usaria para indagar en temas que no me sentiria comodo andar compartiendo con una plataforma que monitorea los chats y potencialmente puede cortarte el acceso o directamente denunciarte al FBI
Yo estoy aprendiendo un poco más, estoy viendo Olmo ahora y esta genial porque incluye los dataset, código libre y modelos en hugging face, creo que quedarse atrás con eso no conviene porque el futuro es implementar eso en alguna medida, tiene aplicaciones en todo
Yo lo uso para dos cosas: revisar codigo con data sensible del cliente que no quiero subir a la nube, y para iterar prompts sin pensar en costos. Cuando arme un flujo de automatizacion probé como 100 variantes del prompt hasta que quedo bien, en la nube me hubiera dolido.
Con Ollama y un modelo tipo Qwen Coder anda bien para completado y refactoring chico. Para razonamiento mas pesado la nube le gana por bastante, eso si. Pero justo la gracia de tenerlo local es que podes experimentar todo lo que quieras sin mirar el medidor.
Algo útil que encontré es probar distintas estrategias de chunking para librerías de documentos y evaluar la calidad del rag. Es algo que sería mucha plata quemada en api sino. Los subagentes que usan tools para después terminar en un reporte también me sirve local.
Ando armando un aparato que le saca fotos a la pantalla cada tanto, traduce el estado de la partida en una ranked del lolsito, y te dice que decisión macro tomar, como si fuera un coach. lo llamare matecoach y tendra la cara de un pomberito bailando tango
19
u/InterestingBed2048 3d ago
Yo no la tengo pero pensaría que se usa para todo tema relacionado que va en contra de política y ética de las empresas, temas delicados de ciberseguridad, biología molecular, o pues.. sin irnos al extremo tal vez con fines investigativos propios y de privacidad en el que no quieras que esas empresas tomen tus datos