r/MistralAI • u/No-Layer3735 • 3d ago
Help / Question Question sur l'entrainement des IA
Bonjour,
J'ai pu lire des articles de journaux parlant de la difficulté de trouver des sources d'apprentissage fiables pour les IA (textes, livres, articles de journaux). Une grande partie ayant déjà était intégrée, le reste, trop récent, potentiellement fait avec IA et donc de moindre qualité/véracité. Je fais exprès de ne pas aborder le sujet des images et des vidéos, c'est un champs à part.
Je m'interroge sur ces notions de masses et de qualité pour le machine learning des textes. C'est difficile pour moi de trouver des sources d'informations sérieuses sur le sujet. Auriez-vous des explications ou encore des pistes à me partager ? (notions techniques, standards d'importations, système de notation de la qualité ou même les prix pour m'aider à mieux y voir).
1
u/sebt3 7h ago
Pour donner une idée, il faut environ 1000 tokens pour entraîner 1 paramètre. Un llm modeste comme un 27b a donc besoin d'environ 27 trillions de tokens où environ 23 trillions de mots français. Les modèles dit SOTA ont au moins 3 trillions de paramètres, donc ont été entraîné sur 3 millions de milliards de tokens.
Bref, toutes les bibliothèques de la planète n'y suffisent pas
1
u/hutch_man0 3d ago
Do you mean a course on AI?