Une proposition sur Hugging Face discute de deux problèmes interconnectés dans l'IA : la dépendance à l'entraînement de grands modèles séparés et la dépendance de l'écosystème aux GPU à usage général.
- L'auteur suggère la « croissance progressive des modèles », où un modèle s'étend structurellement (par exemple, de 4B à 8B) en préservant les représentations apprises, plutôt que de recommencer à zéro pour chaque taille.
- Cette approche complète le transfert de connaissances de taille fixe, permettant aux modèles d'absorber plus de capacités avant qu'une expansion structurelle ne soit nécessaire.
- Pour répondre aux limitations matérielles, l'auteur propose un « Profil Matériel IA » pour les Transformers, définissant un ensemble stable d'opérations courantes (comme GEMM et l'attention) pour les fabricants spécialisés de ASIC.
- La proposition soutient que les versions de modèles devraient évaluer des métriques d'efficacité telles que les tokens par joule et les exigences mémoire alongside le nombre de paramètres.
L'auteur estime que ces changements pourraient aider les utilisateurs locaux d'IA à surmonter les limites de VRAM et fournir aux fabricants de matériel une cible d'optimisation claire.