CCF & LLM Tool : l'apprentissage automatique au service de la recherche climatique et des sciences sociales
La base CCF est le premier corpus médiatique climatique pan-canadien annoté par apprentissage automatique, ouvert, avec 47 ans de profondeur historique et une couverture bilingue EN/FR. Cadres, acteurs, événements et lieux sont annotés au niveau de la phrase, de sorte qu'on peut répondre depuis la même ressource — quantitativement ou qualitativement, via un explorateur web et une API ouverte — aux questions sur l'évolution des cadres thématiques depuis 1978, les patterns régionaux de dépendance aux énergies fossiles, qui structure la politique climatique (le réseau de 110 décideurs de 2024) et comment se propage une cascade médiatique (la cascade Santé de l'été 2023).
Derrière le corpus, LLM Tool transforme prompting, nettoyage, entraînement et inférence en un workflow local consigné, avec cinq modes (Annotator, Annotator Factory, Training Arena, BERT Annotation Studio, Validation Lab). Les classifieurs XLM-RoBERTa distillés atteignent la précision des modèles GPT-5 sur le jeu de test par consensus humain tout en étant 109 à 395 fois plus rapides par phrase. Prompts, schémas, versions de modèles, hyperparamètres, échecs et sorties sont consignés comme partie intégrante de la méthode, pour que le workflow puisse être inspecté, adapté et réutilisé au-delà du climat, pour toute tâche d'annotation phrase à phrase.