One month coding with GLM 5.3 Flash
L'équipe avait pour objectif de passer tout le mois sur le modèle GLM 5.3 Flash et a réussi à y consacrer la première moitié du mois. La consommation et le coût pendant cette période étaient faibles, mais la seconde moitié a basculé vers d'autres modèles et a généré environ un milliard de tokens supplémentaires. Un prototype expérimental du serveur Wagtail MCP utilisant du "vibe coding" a provoqué un choix de modèle inapproprié qui a coûté environ 450 millions de tokens, 150 dollars et 5 kWh malgré une démonstration fonctionnelle. Des problèmes de disponibilité d'infrastructure chez les fournisseurs d'inférence ont aussi obligé l'équipe à basculer vers des modèles alternatifs comme DeepSeek V4.1 Flash et Qwen 3.8 Flash pour maintenir les performances. Les leçons tirées incluent la nécessité de mesurer localement l'usage et l'énergie, de budgéter l'expérimentation, d'améliorer la sélection de prompts et d'agents, et de viser l'essentiel des inférences sur des modèles flash efficaces.