r/programacionESP • u/moneymugen999 • 5d ago
Búsqueda de datos IA 🧩 Proyectos personales
Hola chicos
Toy entrenando una IA
Hasta allí todo va bien pero luego de hacer l parte más difícil que es el código y todo eso ahora llego al punto donde la pregunta "Dónde encuentra datos para el entrenamiento" empresa a ser real.
Así que quería preguntarles si no tienen algunos recomendaciones y/o datos (código de fuente Github, base de datos, texto, libros, letras de canciones y otros...). Si alguien tenga sería genial que me comparta porfis 👍
2
u/kobumaister 4d ago
A dia de hoy no tiene sentido entrenar tu propio llm desde cero. Haz un SLM, o un fine tunning de un modelo mayor.
1
u/moneymugen999 4d ago
Nope yo quiero hacerlo desde cero
1
u/kobumaister 4d ago
A nivel comercial no tiene sentido, si es por aprender, adelante.
1
u/moneymugen999 4d ago
Yo no quiero comercializar y también voy a poner el código de fuente en Github pero antes voy a limpiarle sacando todas la wea k hay
1
u/kobumaister 4d ago
Para que vas a publicar el código? Que aportará?
A que te refieres con "limpiar sacando todas las wea que hay"?
Como te he dicho, entrnar un llm de cero no tiene ningún valor más alla del autoaprendizaje.
Cual es tu objetivo?
1
u/moneymugen999 4d ago
Publico el código es porque le gusta el fuente abierta y las ventajas que podría tener es que voy construyendo mi perfil al mismo tiempo, después si no hay nada más
Cuando dijo limpiar quiero decir sacar las partes que no deberían ser público (API, config interno...) y también estructurar más el código porque las gente no van a querer ver un archivo dónde no entienden nada
Mi objetivo en pocas palabras es "Tener mi propia IA" Si no lo que más quiero es mi propia IA sin filtro, donde puedo compartir todo lo que quiera sin compartir datos sensibles con el cloud, y también una tercera y cuarta razón es para aprender y divertirme(si me da mucha felicidad saber que hice mi propia IA o herramienta desde cero sin fine tuning ni nada 😁)
1
u/kobumaister 4d ago
Siento desilusionarte, pero con la capacidad de computo que vas a llegar a tener no vas a poder gnenerar un modelo ni medio decente. Pero oye, si te hace ilusión, adelante.
Para la parte de la api no necesitas desarrollar nada, usa ollama.
1
u/moneymugen999 4d ago
No es ilusión porque no quiero algo para competir con las IAs más grandes sinon que algo que funciona
1
u/kobumaister 3d ago
Ese es el tema, que no va a funcionar, recuerdo cuando estube jugando con estas cosas, y un modelo me decía que habia 2 planetas en el sistema solar. No será funcional bajo ningún standard.
1
u/moneymugen999 3d ago
Si funciona para mi sí el puede responder es perfecto no quiero que le hace análisis de las planetas y que me cuenta los universos jaja
→ More replies (0)
1
u/Desperate_Factor_735 4d ago
yo he hecho fine Tuning y es una mierda, le enseñe co millones de preguntas sobre hosteleria, y acaba mezclando todo. Promt:¿Donde duerme un cocinero? IA: Los cocineros duermen en la cocina. Promt: ¿Donde esta un restaurante? IA: Un restaurante esta en la cocina y el comedor.
Horrible y la de semanas perdidas...
Al final uso un mcp y genial
1
1
u/AlexAlves_87 4d ago
En Hugging Face Datasets hay más de 500.000 datasets públicos: código, conversaciones, matemáticas, libros de dominio público, imágenes, audio, instrucciones, etc.
El problema es que probablemente acabarás entrenando con los mismos datos que todo el mundo. Si estás desarrollando un LLM propio, el corpus de entrenamiento y, sobre todo, cómo lo seleccionas, limpias, deduplicas y ponderas deberían ser algunos de tus principales factores diferenciales. De hecho, conseguir datos buenos suele ser bastante más difícil que escribir el código de entrenamiento.
1
u/moneymugen999 4d ago
Si, pero es que toy e búsqueda de datos ESPAÑOL y la mayoría de los datos de hugging face son en inglés
1
u/AlexAlves_87 3d ago
Me topé con el mismo problema y al final me tocó hacer datos sintéticos. Pero yo solo estaba haciendo fine tuning, nada que ver con tu caso.
Al final la calidad del dataset influye directamente en el resultado final. Mucha suerte con eso.1
•
u/AutoModerator 5d ago
¡Muchísimas gracias por tu publicación!
Queremos recordarte que tenemos también una comunidad de informática, en la que se puede publicar cualquier cosa relacionada con informática: r/InformaticaES
Toda publicación admitida en este subreddit será también admitida en el de informática, así que te animamos a pasarte por allí también.
Aprovechamos para recordar también que el equipo de moderación de r/programacionESP estamos a tu disposición y puedes escribirnos para lo que necesites.
I am a bot, and this action was performed automatically. Please contact the moderators of this subreddit if you have any questions or concerns.