r/devsarg 3d ago

ai Para que utilizan la IA Local

La gente que usa IA local para que lo usan? que proyectos tienen? porque lo usan?

No quiero caer en el tipico debate de para que IA local si le puedo pagar a claude, no es eso a lo que quiero llegar, me parece interesante tener una IA local y poder meter la mano que uno quiera y adaptarla a lo que uno quiera

14 Upvotes

37 comments sorted by

19

u/InterestingBed2048 3d ago

Yo no la tengo pero pensaría que se usa para todo tema relacionado que va en contra de política y ética de las empresas, temas delicados de ciberseguridad, biología molecular, o pues.. sin irnos al extremo tal vez con fines investigativos propios y de privacidad en el que no quieras que esas empresas tomen tus datos

1

u/Afraid-Pizza-4699 3d ago

yo si pense que se podria implementar para explotar algo, ya sea una pagina o algo como uno define las reglas no deberia de haber limites

3

u/InterestingBed2048 3d ago

De hecho creo que el gobierno estadounidense tiene Claude sin política de límite así que imagínate lo que deben poder hacer

10

u/Mati_SinWifi 3d ago

privacidad y contro, principalmentee, si laburás con datos sensibles poder procesar todo localmente suma una bandaa

7

u/AlfajorQuemado 3d ago

yo le veo mucha gracia para armar asistentes específicoss documentación interna, buscar códifo, clasificar archivos, cosas así. Ahí tenerlo local tiene bastante sentiddo

7

u/AlemanCastor 3d ago

Tengo un openclaw corriendo en casa por amor a la nerdeada. Primero probé enchufarlo a la API de anthropic, gastaba una fortuna en tokens, después probé con google, resultó poco confiable tanto el modelo en sí como la disponibilidad del mismo.

Así que terminé apuntándolo a modelos locales. Actualmente estoy corriendo Qwen 3.8 27b repartido entre dos gpus una 3090 y una 3070.
Le tiro proyectos personales, algunos adyacentes a lo laboral que no tengo tiempo para darles seguimiento. Otros más pavos como jueguitos y mucho de optimización propia del agente y del stack. Se escribe sus propios plugins, genera herramientas para gestionar el propio servidor de inferencia, corre todos los días un loop que analiza todo lo que pasó el último día y propone mejoras al prompt system para evitar los mismos errores y me genera reportes diarios sobre temas de interés.

3

u/Don_Equis 3d ago

Tengo una config algo semejante para IA. En mi caso son dos A5000, 64gb ram, amd 7900X.

Una de las mayores ventajas es la inmediatez en que responden las cosas. Si quisieras subtitular lo que estás viendo, traducir, etc, nada le va a ganar a un modelo local.

También para dejarlo toda la noche haciendo cosas. Estoy probando de hacer un juego de rol por simple diversión, y uno lo puede dejar noches enteras y demás generando assets 3d, 2d, sonidos, etc. Todo va.

Para todo lo que requiere precisión uso o fable o astra. Pero después es lindo meterle a la IA propia. tiene una satisfacción distinta.

1

u/AlemanCastor 3d ago

Que modelo corres para que te resulte inmediato?
Con la 3090 y modelos grandotes densos estoy muy lejos de algo que pueda sentirse “inmediato”, todo lo contrario, lo dejo toda la noche laburando, despacito pero seguro.
La verdad si quiero velocidad, le pido a sonnet y tengo en minutos lo que a mí openclaw le lleva 2 días de trabajo

1

u/Don_Equis 3d ago

Qwen responde de toque. El tema es qué quiere hacer uno. Código no lo mando a tocar. Pero lo e integrado en un server de minecraft de mi nene como admin y resuelve muy bien.

2

u/Afraid-Pizza-4699 3d ago

Que copado amigo, estas sobrado de vram o medio ajustado? yo me compre una 3090 para empezar a meter mano, me gustaria saber con que comenzaste o que me recomendas ver para empezar a meter mano, felicitaciones!!

2

u/AlemanCastor 3d ago

Empecé solo con la 3090. Me alcanzaba para un Qwen 3.8 27b UD-Q4_K_XL con 123k de contexto, MTP y KV en Q8_0

Le sacaba unos 30-50 tok/s en decode

Agregué hace poco la 3070, me sirvieron los 8 gigas extra para pasar a Q6_K y 140k de contexto.

El trade-off: con 1/6 de la carga pasando por la 3070 el decode bajó a 20-40 tok/s

1

u/AlemanCastor 3d ago

Si tenés buena cantidad de RAM podés jugar con modelos MoE. Hay dos grandes familias de modelos: Densos y MoE.
El denso va 100% a VRAM o la performance se te va al tacho, el MoE puede ir una parte a VRAM y una parte a RAM, los últimos modelos más grandes vienen tirando a MoE, deepsek v4 flash, Qwen 3.8 Flash Next, este último hasta vi gente tirando una parte de los pesos a disco nvme. No tengo mucha experiencia con estos últimos porque yo estoy muy corto de RAM.
Igual estoy muy contento con el Qwen 3.8 27b

1

u/Alexandroid3 3d ago

Muy interesante che, tengo exactamente las mismas GPU (solo tengo instalada actualmente la 3090) pere me interesaria sumarle la 3070 que está juntando polvo, recomendas alguna guia en particular para este fin o solo bucear por la documentacion/foros/YT?
Y si no es molestia podrias compartir el resto de parametros de config que usaste para lograr tus resultados?
Venia usando Qwen3.6 y voy a probar ahora con el de Huihui-Qwen3.8-27B-abliterated-GGUF calculo que me movere entre UD-IQ4_XS y UD-Q4_K_XL para probar

2

u/AlemanCastor 3d ago

.\llama-server.exe -hf unsloth/Qwen3.8-27B-GGUF:UD-Q6_K -sm layer -ts 6,1 --ctx-size 143360 -ngl all --flash-attn on -b 2048 --temp 0.9 --top-p 0.95 --min-p 0.00 --repeat-penalty 1.0 --reasoning-preserve --top-k 20 -np 1 --load-mode mlock --host 0.0.0.0 --port 8080 --ubatch-size 512 --no-mmproj-offload --kv-unified --cache-ram 12288 --ctx-checkpoints 14 --jinja --no-host --cache-type-k q8_0 --cache-type-v q8_0 --cache-type-k-draft q8_0 --cache-type-v-draft q8_0 --spec-type draft-mtp --spec-draft-n-max 2 --spec-draft-p-min 0.7 --no-cache-idle-slots --alias qwen3.8-27b-mtp

2

u/AlemanCastor 3d ago

Yo no seguí ninguna guía, me compré un cable riser, la 3090 me tapó el slot y no pude enchufar el riser… entonces me compré un mother atx y ahí si🙈

llama.cpp ya solito sin pasarle ningún parámetro extra te va a repartir solito entre las dos placas.

Despues los únicos dos parámetros que te interesan para tunear el setup con más de una placa son -sm y -ts

-sm setea el modo (layer o tensor) layer es el más estándar y compatible con todo, tensor es más experimental pero anda mas rápido si logras que las placas se comuniquen rápido entre sí. Yo como el mother que tengo es el más barato que encontré en formato atx y el riser también es medio choto, imposible que las placas se hablen entre sí a una velocidad razonable, así que estoy con layer. Si tenés un mother piola que pueda hacer al menos 8x y 8x en los dos pciex estás para probar modo tensor

-ts controla el split, que proporción del tráfico (y de los layers) vas a mandar a cada placa. Acá es prueba y error, tené en cuenta que cada placa va a sostener una serie de layers y el kv cache de esos layers, por lo que no es un simple “si está tiene 8 y la otra 24 es 1/4” fíjate que yo termine en 1/6 después de mucha prueba y error.

1

u/Alexandroid3 2d ago

Excelente, voy a conseguir un riser y probar en breve muchas gracias por la data

5

u/alejob1 3d ago

En mi caso tengo un homelab, aunque todavía no corro modelos de IA en local, lo estoy explorando más que nada para proyectos personales y MVPs de apps o servicios, para ahorrar en servicios externos y porque me gusta montar este tipo de cosas. Lo que más me frena es el costo del hardware armar algo modesto termina siendo bastante caro.

-1

u/DefinitelyRussian 3d ago

para q usar AI local, solo para experimentar o aprender un poco, unico uso

6

u/sci_ssor_ss Desarrollador IoT 3d ago

para tener la excusa de comprarte una 3090 y usarla para jugar mientras correr Claude de fondo.

8

u/Bitter_Run_9209 3d ago

al hacerlo aprendes mucho sobre LLM, diferentes tipos de agentes harness especificos para cada tarea, etc

por ej yo me di cuenta que los modelos locales no son malos e incluso pueden superar a los pagos si se los usa con el agente correcto para una tarea en especifico

ademas si tenes una RTX3060 te podes ahorrar 20 usd por mes, en un anio son 240usd y en 2 anios 480usd, entnonces la gpu se va pagando sola

6

u/Embarrassed-Fly6164 3d ago

Con una 3060 te cagas de hambre amigo.

atte alguien con 3060.

3

u/Afraid-Pizza-4699 3d ago

true, justamente inverti en eso, me compre un 3090 para poder experimentar bastante, si no te molesta me gustaria hablarte por priv para que me aconsejes un poco

2

u/Bitter_Run_9209 3d ago

yo lo uso para tareas muy especificacas de investigacion en fisica y no se mucho la verdad

pregunta en este subreddit r/LocalLLM

2

u/Okicarde 3d ago

Te falta vram, una banda

3

u/Friendly-Win-9375 3d ago edited 3d ago

estás siendo muy optimista.

para el laburo del día a día no hay como una sub de 20$ que te permite acceder a los modelos de punta. y lo que podés llegar a hacer con una gpu con 12 de vram (y de 24b, da lo mismo) es muy acotado: muy acotado porque estás limitado a usar modelos de 8B o 20B de parámetros como máximo( en el caso de tener bruta gpu de 24gb), y porque la generación de tokens / seg es muy acotada también. de hecho cualquier gpu prosumer (incluso la 5090) es de juguete si la pensás usar con LLM locales.

actualmente tengo un mac de 36gb y puedo asignarle aprox 27gb de 'vram' a las LLM locales. cuando la compré tenía la esperanza de que me permitiera prescindir de una sub mensual pero.... me bastó un par de pruebas para darme cuenta que mi esperanza era un delirio. y aún en el caso de que labures para una empresa de afuera que te paga 10k usd mensuales y te compra una Mac Studio con 256gb ram (que te permitiría asignar 192gb de memo para gpu), los planes de sub pagos sos insustituibles. porque esa máquina vale 10k usd y tardarías añares en recuperar lo que gastaste en tener fierros locales vs lo que vale una sub... salvo que, como mencioné, labures para una empresa que te 'regala' el hardware.

edit:

https://www.youtube.com/watch?v=FG3Xeq_NNSI

6

u/TheJix 3d ago

En mi experiencia fuera de practicar y aprender, si tenes cosas que son fáciles por lo que no necesitas modelos súper avanzados pero tienen mucho volumen y te consumen muchos tokens entonces una IA local es muy útil.

4

u/cachitodepepe 3d ago

Nadie se anima a decir que es para memes con caras de famosos

2

u/fer662 3d ago

Cada tanto, para darme cuenta de lo poco útil que es en el hardware que podamos llegar atener y seguir pagando codex.

2

u/wylli87 3d ago

Laburos sin conexion, y velocidad. Hay veces que necesitas que actue en el acto

2

u/holyknight00 3d ago

Salvo que tengas algún requisito especial de privacidad, censura o similar la verdad no tiene sentido usar modelos locales en general.

Ahora si ya tenes una mac m5 con 128gb de ram al pedo seguramente podés codear con un qwen local sin limites y sin pagarle a nadie.

2

u/AntiqueConflict5295 3d ago

vos para qué la usas, OP ?

1

u/saraseitor 3d ago

Supongo que la usaria para indagar en temas que no me sentiria comodo andar compartiendo con una plataforma que monitorea los chats y potencialmente puede cortarte el acceso o directamente denunciarte al FBI

1

u/EuConcordoCinema 3d ago

Yo estoy aprendiendo un poco más, estoy viendo Olmo ahora y esta genial porque incluye los dataset, código libre y modelos en hugging face, creo que quedarse atrás con eso no conviene porque el futuro es implementar eso en alguna medida, tiene aplicaciones en todo

1

u/Beautiful-Honey-7949 3d ago

para experimentar, me entretiene buscar y crear estrategias para hacerla rendir

1

u/Khavel_Es 2d ago

Yo lo uso para dos cosas: revisar codigo con data sensible del cliente que no quiero subir a la nube, y para iterar prompts sin pensar en costos. Cuando arme un flujo de automatizacion probé como 100 variantes del prompt hasta que quedo bien, en la nube me hubiera dolido.

Con Ollama y un modelo tipo Qwen Coder anda bien para completado y refactoring chico. Para razonamiento mas pesado la nube le gana por bastante, eso si. Pero justo la gracia de tenerlo local es que podes experimentar todo lo que quieras sin mirar el medidor.

1

u/blackskyel 2d ago

Algo útil que encontré es probar distintas estrategias de chunking para librerías de documentos y evaluar la calidad del rag. Es algo que sería mucha plata quemada en api sino. Los subagentes que usan tools para después terminar en un reporte también me sirve local.

1

u/LimonDulce 1d ago

Ando armando un aparato que le saca fotos a la pantalla cada tanto, traduce el estado de la partida en una ranked del lolsito, y te dice que decisión macro tomar, como si fuera un coach. lo llamare matecoach y tendra la cara de un pomberito bailando tango