Show HN: Steerling-8B, a language model that can explain any token it generates
Steerling-8B est un modèle de langage de 8 milliards de paramètres interprétable qui peut relier chaque jeton à son contexte d’entrée, à des concepts compréhensibles par l’homme et aux données d’entraînement. Il a été entraîné sur environ 1,35 × 10^12 jetons et atteint une performance en aval équivalente à des modèles entraînés sur deux à sept fois plus de données. Ses capacités incluent le contrôle conceptuel à l’inférence sans réentraînement, la traçabilité des données d’entraînement pour chaque sortie et l’alignement par contrôle de concepts, remplaçant des milliers d’exemples de sécurité par des interventions au niveau des concepts. L’architecture repose sur un backbone causal discret de diffusion et décompose les représentations en trois voies explicites: environ 33 000 concepts supervisés, environ 100 000 concepts découverts et un résiduel, permettant d’ordonner et d’éditer les contributions par concept sans perte de performance. Les poids du modèle de base et le code compagnon sont publiés (HuggingFace, GitHub, PyPI), et les résultats montrent qu’une large part des prédictions provient du module conceptuel, avec une AUC de 96,2 % pour la détection de concepts connus.