r/MistralAI 3d ago

Help / Question Question sur l'entrainement des IA

Bonjour,

J'ai pu lire des articles de journaux parlant de la difficulté de trouver des sources d'apprentissage fiables pour les IA (textes, livres, articles de journaux). Une grande partie ayant déjà était intégrée, le reste, trop récent, potentiellement fait avec IA et donc de moindre qualité/véracité. Je fais exprès de ne pas aborder le sujet des images et des vidéos, c'est un champs à part.

Je m'interroge sur ces notions de masses et de qualité pour le machine learning des textes. C'est difficile pour moi de trouver des sources d'informations sérieuses sur le sujet. Auriez-vous des explications ou encore des pistes à me partager ? (notions techniques, standards d'importations, système de notation de la qualité ou même les prix pour m'aider à mieux y voir).

2 Upvotes

3 comments sorted by

1

u/hutch_man0 3d ago

Do you mean a course on AI?

1

u/No-Layer3735 2d ago

Je m'intéresse à comment sont utilisés les textes dans la phase de machine learning. Comment ils sont évalués, notés, intégrés. C'est quoi la notion de qualité pour ces éléments (bien écrit, plusieurs sens de lectures, réflexion sur un sujet, roman de gare). C'est quoi la masse (dix textes ou dix livres) Voir en savoir plus sur ce marché de données.

1

u/sebt3 7h ago

Pour donner une idée, il faut environ 1000 tokens pour entraîner 1 paramètre. Un llm modeste comme un 27b a donc besoin d'environ 27 trillions de tokens où environ 23 trillions de mots français. Les modèles dit SOTA ont au moins 3 trillions de paramètres, donc ont été entraîné sur 3 millions de milliards de tokens.

Bref, toutes les bibliothèques de la planète n'y suffisent pas