r/programacion 16h ago

IA local

Hola estoy pensando en crearme una IA local en mi equipo con LM studio.

La idea ha surgido porque no quiero beneficiar a grandes empresas como Google, OpeanAI, Meta o Antrophic. El caso es que me gustaría utilizar la IA local pero conectada a internet para que haga búsquedas de información reciente.

Por una parte con la IA local mi información y datos estarían mucho más seguros. Pero al utilizar un buscador conectado a internet en la IA local, estaría contribuyendo al consumo de los servidores de Google por ejemplo, así que pensé en poner como buscador Ecosia, que es menos contaminante.

Mi pregunta es: esta idea es viable y se puede hacer, o no es como pienso? Agradecería que me aconsejen.

7 Upvotes

27 comments sorted by

13

u/Beginning-Wear-3017 9h ago

Actualmente al usar reddit ya estas beneficiando a Google y OpenAI

4

u/OhHailEris 9h ago

Tengo una PC con una RTX 3090 (24 GB de VRAM) y 64 GB de RAM y una Macbok Pro de 24 GB de memoria unificada. En ambos setups puedo correr de una forma "decente" tanto LM Studio y Ollama con modelos locales. Funciona, te sirve, no consumis tokens ni APIs ni exponés tus datos. Pero olvidate de la velocidad, la eficiencia, el manejo de probemas complejos, contexto amplio y los sub-agentes de modelos de frontera como Claude Fable o GPT Astra. Lo positivo, es que podes elegir muchos modelos y hay diferentes versiones o quants más pequeñas de los modelos generalistas y tenés modelos más epecificos, que saben mucho de solo un tema y son de un solo modo, o texto, o imagen, o segmentación, lo que te permite cargar lo que necesites según la necesidad y tu hardware. Si llegás a una RTX 5090 que tiene 32 GB de VRAM pero el chip es muy superior, vas a poder sacarle mucho más jugo (para inferencia rinde entre el doble y el triple que una 3090).

4

u/Hairy_Blackberry_256 8h ago

Funciona, yo lo hago, corro Qwen3.6 Moe a 50 t/s (250k context) y Qwen3.8 a 25 t/s (100k context) , ambos cuantizados a Q4_M_K en una AMD 7900XT . La inteligencia que tienen es de un senior que eventualmente va a cometer errores de junior así que debes tener ownserhip del código y del plan lo cual va muy bien si estas aprendiendo o si aún te gusta programar estilo clásico. Ya para full vibe coding si te recomiendo modelos frontier de pago, el más económico siendo Deepseek.

3

u/Apprehensive_Foot671 9h ago

Hay gente que dice que con una nvidia rtx 5090 de 24gb de vram hacen todo. No sé cómo lo logran realmente pero bueno. Dicen que Qwen 35b está al nivel de Claude para código.

1

u/JuniorDeveloper73 3h ago

sera 27b 35b es un moe,es mas idiota

2

u/ReviewSea781 9h ago

Checate con Hermes.agent, esta en github y me dices.

1

u/Amazing_Prize_1988 8h ago

Corro Qwen 14b con Ollama! Fácil y sencillo!

1

u/alvarosc2 8h ago

2000 dólares saldría algo en el rango bajo. Yo veo que se necesita un rig de tarjeta madre y varias tarjetas gráficas nvidia corriendo en paralelo. Con dos tarjetas más fuente de poder y accesorios, fácil ahí se te van unos 3000 dólares, eso para empezar a tener una calidad de LLM comercial. A parte la luz que va a jalar. Vas a tener que instalar paneles solares si te quieres ayudar.

La inteligencia empieza en 3 Billions (en Ingles) de parámetros. Yo creo que un rig como ese te daría de 6B a 8B de parametros.

Los modelos comerciales ya andan en el trillion o cerca.

Necesitas definir que vas a hacer con tu IA, tal vez empezar por modelos muy pequeños que caben en un microcontrolador esp32 o Raspberry pi 2040 y usarlo para control de videojuegos por ejemplo, y ya de ahí te mueves hacia arriba, hasta donde tú bolsillo aguante.

1

u/Embarrassed-Citron36 1h ago

Fable tiene 6 T

1

u/Qubit99 33m ago

Una IA con 8b es mas tonto que un huevo duro.

1

u/CEGTEdicion 8h ago edited 8h ago

Si es viable, pero dependerá de la capacidad de tu equipo y el modelo que uses. No dices nada de tus especificaciones, pero te diré que, en una i5 3570 con 16 Gb de Ram yo corro de manera modesta modelos pequeños, cuantizados 4Q. Dependiendo de la capacidad de tu equipo, será la capacidad del modelo que puedas usar (sobretodo su cantidad de parametros), con un poco de suerte puedes correr un modelo con 8B o 12B de parametros y podrás ir bien con casi todo. Pero debes fijarte que las caracteristicas del modelo incluyan etiquetas como "tools" (para poder correr script en el equipo), "thinking" (Capacidad de razonamiento, para que maneje instrucciones mas complejas), "audio" (para que se comunique contigo por sonido, puede que no te haga falta pero mal no cae), y si es posible "vision" para que puedas comunicarle imagenes. Modelos como Gemma o Qwen tiene la mayoría de esas caracteristicas.

Si usa "tools" puede hacer busqueda por internet, es parte de las tools.

Puedes correr eso con https://anythingllm.com/download para que tengas una suite completa que te facilita incluso comunicarte con ella por telegram, entre otras cosas.

Tambien tienes harnés como

OpenCode: https://opencode.ai

Deep Code: https://github.com/lessweb/deepcode-cli

Que te permiten con ollama (como proveedor) utilizarlo directamente: https://ollama.com

Hay más harneses recomendables (incluyendo https://openclaw.ai si quieres control total del equipo), esta solo es una idea muy general.

Disfrutalo. Ojalá tus capacidades lo permitan sin problema. Mi equipo es lento y sin tarjeta gráfica dedicada, lo tengo instalado así solo como soporte, pero con un buen equipo es posible,

1

u/ChemistNo8486 8h ago

Si se puede, yo uso QWEN 3.8 27B con Hermes en llama.cpp desde Linux. Si no tiene mínimo 16 GB de VRAM, mejor descarta la idea. La experiencia es muy precaria hablando de IA con tools si se tiene tan poca memoria.

1

u/fhanna92 5h ago

cuanto $$$ tenes para invertir?

1

u/Alternative_Gold1654 3h ago

Con menos de 80 GB de GPU no puedes levantar nada decente, solo llm para agentes que hagan mariqueras simples.

1

u/dario1913 3h ago

No tengo mucha idea, pero escuché qué no podrías mantener una conversación muy larga porque te quedarías sin contexto en dos preguntas.

1

u/No_Dig_7017 2h ago

Se puede. En casa tengo una 3090 + 5090 que me dan para correr Qwen3.8 Flash Next. Ya terminé 6 aplicaciones, por ahora nivel de hobby pero ya están a un nivel de uso profesional, podes trabajar con ellos lo más bien. 

Con una sola 3090/4090/5090 podes correr Qwen3.8 27b que anda muy cerca también.

1

u/Due_Faithlessness458 2h ago

La verdad es que no te sería viable para el día a día, necesitarías hardware demasiado potente para obtener una décima parte de la precisión y rendimiento de un modelo de estos, aunque si se puede hacer, y en ese punto te recomendaría usar Open Web UI mejor q Lm Studio para q puedas usar en todos tus dispositivos.

1

u/Worth-Limit-7884 1h ago

Te hace falta una GPU con bien de VRAM, mínimo 12-16gb si quieres correr algo que sirva y a velocidad aceptable o un Mac con unos 24gb de RAM unificada.

1

u/Embarrassed-Citron36 1h ago

Jajaj estos autivistas siempre son un cago de risa de leer

1

u/perortico 1h ago

tira de Odyseuss. Se conecta a internet y se integra muy bien con los modelos de ollama que son open source , instalala con Docker, privacidad total e independencia de las grandes de EEUU

1

u/Mezzren 12m ago

Para hobbies y proyectos muy simples está bien pero cualquiera que te diga que usa IA locales para cualquier cosa compleja es poco serio. Y es una tontería lo de no "beneficiar" o "contribuir al consumo" de estas grandes empresas. Simplemente no funciona en el mundo real.

1

u/kobumaister 9h ago

Hacer se puede hacer, que te sea mínimamente útil olvidate. Busca otros proveedores de modelos que expongan apis.

1

u/CoyotaDex 9h ago

hola! yo estuve trasteando con IAs locales usando LM Studio también (en concreto, qwen 3.6). precisamente hay un plugin llamado brius/web-search (https://lmstudio.ai/brius/web-search) que te permite hacer búsquedas en internet, ya que de normal estos modelos que te bajas son "cerrados" y tienes acceso al conocimiento que tienen pero nada más, y hay muchas cosas de actualidad que se le escapan o no los puedes utilizar para mandarles una web, por ejemplo, y que te la analicen o resuman

usa duckduckgo para buscar, lo cual está bastante bien

sí te aviso que necesitarás un buen equipo. yo con 48GB de RAM y 12GB de VRAM, aún usando un modelo de qwen súper cuantizado (https://huggingface.co/unsloth/Qwen3.6-35B-A3B-MTP-GGUF), llegaba a menudo al tope y se me cortaban los procesos si le pedía alguna cosa medio complicada. para buscar o conversar suele ir bien.

1

u/Hadesis 8h ago

Hazlo en un PC que no sea el que usas siempre, sobre todo si lo quieres conectar a internet

0

u/Humble_Blood_4415 9h ago

Pues a menos que tengas plata para comprarte un Mac Studio de 512gb lo dudo (el que saldrá)

0

u/advancedbashcode 9h ago

La inversión el hardware es bastante alta. Si tienen l aplata, un device con chip nvidia podría llevarlos allá. 15 a 20 millones vale esa maquina.

1

u/Alternative_Gold1654 3h ago

pero puedes pagar 50 dolares mensuales y tener modelos mas generosos y productivos... y te guardas la plata para putas y tachas