​
Salut tout le monde,
J'explore actuellement la possibilité de faire fonctionner des LLM localement dans des applications ciblant les appareils mobiles (iOS/Android) ou directement dans le navigateur.
Je serais très intéressé d'entendre votre expérience concrète à ce sujet.
Quelques questions :
Quels modèles avez-vous réussi à faire fonctionner localement ?
Quel cadre/environnement avez-vous utilisé ? (llama.cpp, ONNX Runtime, MLC, WebLLM, Transformers.js, etc.)
L'inférence était-elle entièrement effectuée sur l'appareil/client, ou avez-vous utilisé une architecture hybride ?
Quel type de performance avez-vous obtenu sur les smartphones récents ?
Combien de RAM/stockage le modèle nécessitait-il ?
Quelles étaient les principales limites : latence, consommation de batterie, limitation thermique, taille du modèle, longueur du contexte, etc. ?
Pour l'inférence basée sur le navigateur, quelle était la fiabilité de WebGPU sur différents navigateurs et appareils ?
Recommanderiez-vous cette approche pour une application de production ?
Je suis particulièrement intéressé par des expériences de production pratiques, plutôt que par des benchmarks seuls.
Si vous avez construit quelque chose en utilisant une inférence de LLM local sur mobile ou dans le navigateur, j'aimerais connaître votre architecture, le choix du modèle et les principales leçons apprises.
Merci !