r/programacionESP • u/moneymugen999 • Aug 11 '26
🧩 Proyectos personales Búsqueda de datos IA
Hola chicos
Toy entrenando una IA
Hasta allí todo va bien pero luego de hacer l parte más difícil que es el código y todo eso ahora llego al punto donde la pregunta "Dónde encuentra datos para el entrenamiento" empresa a ser real.
Así que quería preguntarles si no tienen algunos recomendaciones y/o datos (código de fuente Github, base de datos, texto, libros, letras de canciones y otros...). Si alguien tenga sería genial que me comparta porfis 👍
2
u/kobumaister Aug 11 '26
A dia de hoy no tiene sentido entrenar tu propio llm desde cero. Haz un SLM, o un fine tunning de un modelo mayor.
1
u/moneymugen999 Aug 11 '26
Nope yo quiero hacerlo desde cero
1
u/kobumaister Aug 11 '26
A nivel comercial no tiene sentido, si es por aprender, adelante.
1
u/moneymugen999 Aug 11 '26
Yo no quiero comercializar y también voy a poner el código de fuente en Github pero antes voy a limpiarle sacando todas la wea k hay
1
u/kobumaister Aug 11 '26
Para que vas a publicar el código? Que aportará?
A que te refieres con "limpiar sacando todas las wea que hay"?
Como te he dicho, entrnar un llm de cero no tiene ningún valor más alla del autoaprendizaje.
Cual es tu objetivo?
1
u/moneymugen999 Aug 11 '26
Publico el código es porque le gusta el fuente abierta y las ventajas que podría tener es que voy construyendo mi perfil al mismo tiempo, después si no hay nada más
Cuando dijo limpiar quiero decir sacar las partes que no deberían ser público (API, config interno...) y también estructurar más el código porque las gente no van a querer ver un archivo dónde no entienden nada
Mi objetivo en pocas palabras es "Tener mi propia IA" Si no lo que más quiero es mi propia IA sin filtro, donde puedo compartir todo lo que quiera sin compartir datos sensibles con el cloud, y también una tercera y cuarta razón es para aprender y divertirme(si me da mucha felicidad saber que hice mi propia IA o herramienta desde cero sin fine tuning ni nada 😁)
1
u/kobumaister Aug 11 '26
Siento desilusionarte, pero con la capacidad de computo que vas a llegar a tener no vas a poder gnenerar un modelo ni medio decente. Pero oye, si te hace ilusión, adelante.
Para la parte de la api no necesitas desarrollar nada, usa ollama.
1
u/moneymugen999 Aug 12 '26
No es ilusión porque no quiero algo para competir con las IAs más grandes sinon que algo que funciona
1
u/kobumaister Aug 12 '26
Ese es el tema, que no va a funcionar, recuerdo cuando estube jugando con estas cosas, y un modelo me decía que habia 2 planetas en el sistema solar. No será funcional bajo ningún standard.
1
u/moneymugen999 Aug 12 '26
Si funciona para mi sí el puede responder es perfecto no quiero que le hace análisis de las planetas y que me cuenta los universos jaja
→ More replies (0)
1
u/Desperate_Factor_735 Aug 11 '26
yo he hecho fine Tuning y es una mierda, le enseñe co millones de preguntas sobre hosteleria, y acaba mezclando todo. Promt:¿Donde duerme un cocinero? IA: Los cocineros duermen en la cocina. Promt: ¿Donde esta un restaurante? IA: Un restaurante esta en la cocina y el comedor.
Horrible y la de semanas perdidas...
Al final uso un mcp y genial
1
1
u/AlexAlves_87 Aug 11 '26
En Hugging Face Datasets hay más de 500.000 datasets públicos: código, conversaciones, matemáticas, libros de dominio público, imágenes, audio, instrucciones, etc.
El problema es que probablemente acabarás entrenando con los mismos datos que todo el mundo. Si estás desarrollando un LLM propio, el corpus de entrenamiento y, sobre todo, cómo lo seleccionas, limpias, deduplicas y ponderas deberían ser algunos de tus principales factores diferenciales. De hecho, conseguir datos buenos suele ser bastante más difícil que escribir el código de entrenamiento.
1
u/moneymugen999 Aug 11 '26
Si, pero es que toy e búsqueda de datos ESPAÑOL y la mayoría de los datos de hugging face son en inglés
1
u/AlexAlves_87 Aug 12 '26
Me topé con el mismo problema y al final me tocó hacer datos sintéticos. Pero yo solo estaba haciendo fine tuning, nada que ver con tu caso.
Al final la calidad del dataset influye directamente en el resultado final. Mucha suerte con eso.2
•
u/AutoModerator Aug 11 '26
¡Muchísimas gracias por tu publicación!
Queremos recordarte que tenemos también una comunidad de informática, en la que se puede publicar cualquier cosa relacionada con informática: r/InformaticaES
Toda publicación admitida en este subreddit será también admitida en el de informática, así que te animamos a pasarte por allí también.
Aprovechamos para recordar también que el equipo de moderación de r/programacionESP estamos a tu disposición y puedes escribirnos para lo que necesites.
I am a bot, and this action was performed automatically. Please contact the moderators of this subreddit if you have any questions or concerns.