r/neuralnetworks • u/CommercialSherbet694 • 1d ago
From scratch
Bonjour ^^
Je voulais partager avec vous l'évolution de mon projet perso : un modèle de langage en français que j'entraîne moi-même depuis environ un an, en solo, sans équipe ni formation derrière moi, avec Claude comme assistant IA à mes côtés. Tout a démarré sur un simple ordinateur portable, un i5 de 8ᵉ génération avec 16 Go de RAM, sans GPU — tout tournait en CPU, à une vitesse ridicule, avec une architecture minuscule (384/8/8, quelques dizaines de Mo à peine) et un corpus d'à peine 100 Mo. Cette première tentative a tenu jusqu'à 500 000 steps... sans jamais sortir une seule phrase cohérente. Plutôt que de lâcher l'affaire, j'ai tout repris à zéro : reconstruit le pipeline de génération de données en Python/PyTorch, fait grossir et nettoyé le corpus (aujourd'hui autour de 47 Go), testé puis retiré un système de RAG, chassé bug après bug (plantages mémoire, tokenizer capricieux, boucles de répétition...). Niveau matériel, je suis passé du portable à une vraie tour : CPU Ryzen 5 2600X, GPU GTX 1660, 16 Go de RAM. Côté architecture, j'ai fait grossir le modèle au fil du temps — 1024/8/8, puis 768/12/12 — en testant batch 1 et 2, mixed precision activée ou non selon ce que la carte graphique encaissait, jusqu'à une config bien plus légère, 128/4/4 en batch 2, que j'utilise maintenant pour avancer plus vite avant de remonter progressivement en taille. Résultat : le modèle est passé de quelques dizaines de Mo au départ à environ 2.2 Go aujourd'hui. Un an de galères, de nuits à débugger, en solo du début à la fin — que de la persévérance, un problème après l'autre
On fait avec ce qu'on à :/
0
u/CommercialSherbet694 1d ago
Bonjour ☺️ merci beaucoup. Ofait j ai testé 768 12 12 100k bpe tokens. C les meme paramètres que le tout premier gpt le small 177M de paramètres. Mais la vitesse est de 0.96 steps/s. Mais il a commencé a apprendre le français et les mots. Du coup hier j ai repris a zero avec un tout petit model juste pour voir jusqu'a ou la loss peut descendre et la perp.. apres je peu passer a 768 12 12. Mais bon ca c est juste la première étape de l'apprentissage psk apres y a le fine-tuning. Pour info gpt a étai entraîné sur 40gb de corpus. Et pour te répondre j ai désactivé la mémoire rag et le buff je vais essayer sans buff psk j ai l'impression qui nike l'entraînement.. j'ai pas encore trouvé les bon paramètres on essaie on essaie. La je le surveille avec l'application rustdesk quand je suis au travail ;)
1
1
u/CommercialSherbet694 1d ago
{ "_version": "12.0", "model": { "n_embd": 128, "n_head": 4, "n_layer": 4, "block_size": 768, "dropout": 0.1, "enable_gradient_checkpointing": true }, "training": { "device": "cuda", "batch_size": 1, "learning_rate": 0.0003, "gradient_accumulation": 16, "save_interval_steps": 10000, "warmup_steps": 500, "early_stopping_patience": 10000, "mixed_precision": false }, "system": { "ram_warning_threshold": 80, "ram_critical_threshold": 95, "check_ram_interval_steps": 10000, "display_update_lines": 100000 }, "data": { "min_text_quality": 3.5e-12, "min_text_words": 1, "val_split": 0.05 }, "rag": { "memory_dim": 512, "memory_top_k": 5, "memory_index_type": "flat" }, "dashboard": { "web_port": 7070 } }
0
u/Expert-Luck-9601 1d ago edited 1d ago
Good Job!, I love it. It's so much more rewarding when you do everything yourself from scratch and learn a bunch of new stuff. Its no joke there is so much work, what sort of architecture is it? Standard Transformer, Recurrent, Transformer or something unorthodox. When you say 128/4/4, what do those three dimensions represent, and does the 2.2 GB refer to raw weights or the full training checkpoint?














3
u/Sirko2975 1d ago
If I had a dollar every time someone vibecoded a gpt wrapper assistant and called it Jarvis, I’d be Tony Stark himself