Jev-Driven SRE Diagnosis: What Worked and What Failed
Les auteurs présentent une chaîne de diagnostic pilotée par Jev sans agent LLM, où un collecteur programmatique rassemble et organise l'état du cluster, Jev choisit une cause probable et des observations de soutien, et le pipeline assemble le rapport de diagnostic. Le collecteur lit les objets Kubernetes, les événements, les logs récents et l'utilisation des ressources, regroupe les observations par composant et produit des résumés que Jev utilise pour sélectionner un composant à inspecter puis des éléments de preuve détaillés. Sur 21 pannes SREGym‑Lite testées cinq fois chacune (105 diagnostics), le pipeline a réussi 80 diagnostics (76,2 %) avec un temps médian de 14,6 secondes par diagnostic, 252 appels Jev au total et un coût d'inférence estimé très faible par rapport aux grands modèles. Un exemple réussi est la panne mutating_webhook_resource_limits où le collecteur a repéré l'écart Pod‑template et le webhook correspondant, tandis que les échecs tiennent soit à Jev privilégiant le mauvais indice soit à l'absence de preuves décisives pour des interactions entre services. Les auteurs concluent que la granularité des données collectées et les choix de Jev sont cruciaux, et proposent d'étendre le pipeline aux causes multi‑services et temporelles en ajoutant des modèles spécialisés pour traduire la télémétrie et mieux intégrer Jev dans les flux de travail SRE.