Comment sont calculées nos prévisions de prix

Nos prévisions à 3, 7 et 14 jours ne sont pas des chiffres sortis d'un chapeau : elles combinent un modèle de machine learning (qui croise prix, pétrole, taux de change, calendrier scolaire, trafic routier et actualité pétrolière) et un modèle statistique de secours, recalculés chaque jour. Voici comment ça fonctionne, en détail.

Vue d'ensemble

Le calcul repose sur deux couches, utilisées l'une après l'autre :

  • Le modèle principal, un ensemble de deux algorithmes de machine learning (XGBoost et LightGBM), entraîné sur l'historique des prix, le cours du pétrole, le taux de change, le calendrier (vacances scolaires, jours fériés), le trafic routier prévisionnel et l'actualité pétrolière.
  • Un modèle statistique de secours, qui prend le relais automatiquement si le modèle IA n'a pas produit de résultat récent (par exemple en cas de panne du pipeline d'entraînement) — jamais de prévision périmée servie silencieusement.

Les données utilisées

Le modèle principal ne se limite pas au prix du pétrole : il combine une dizaine de sources, mises à jour quotidiennement :

  • L'historique des prix à la pompe en France et en Espagne, par carburant (gazole, SP95, SP98, E10, E85, GPLc), issu des jeux de données officiels ouverts (data.gouv.fr côté France, ministère de l'Industrie côté Espagne) — retraités hors taxe (TVA et TICPE retirées) avant tout calcul, pour que le modèle apprenne sur la vraie dynamique du marché plutôt que sur des variations de fiscalité.
  • Le cours du pétrole brut Brent et le taux de change EUR/USD, puisque le baril s'achète en dollars.
  • La marge de raffinage (l'écart entre le prix hors taxe du carburant et le coût du baril, parfois appelé crack spread), qui capte les tensions propres aux raffineries européennes, indépendamment du cours du brut.
  • Le calendrier : jour de la semaine, mois, jours fériés, et vacances scolaires détaillées par zone A/B/C (pas seulement "vacances ou non").
  • Le trafic routier prévisionnel, via les données officielles Bison Futé.
  • Les stocks d'essence américains (données EIA), un indicateur d'offre/demande mondial suivi par les marchés pétroliers.
  • Un score de sentiment de marché, calculé par IA à partir de titres d'actualité pétrole/OPEP, pour capter un choc géopolitique avant qu'il ne se reflète pleinement dans les prix.
  • L'historique des prévisions elles-mêmes, pour mesurer leur erreur réelle une fois l'échéance passée et ajuster la pondération des modèles en conséquence.

Une correction historique compense par ailleurs la remise carburant de l'État de fin 2022, pour que le modèle n'apprenne pas cette baisse ponctuelle comme une tendance de marché normale.

Le modèle principal : machine learning (XGBoost + LightGBM)

Deux modèles de gradient boosting, XGBoost et LightGBM, sont entraînés sur l'ensemble des données ci-dessus et combinés à parts égales (50/50). Chaque carburant et chaque horizon (de J+1 à J+31) dispose de son propre couple de modèles, optimisés automatiquement (recherche d'hyperparamètres via Optuna) — soit plusieurs dizaines de modèles entraînés séparément. Plutôt que de prédire un prix absolu, le modèle prédit la variation attendue par rapport au dernier prix connu, une approche plus stable statistiquement. Le pipeline d'entraînement tourne en dehors du site (en Python) et publie ses prévisions dans un fichier consommé par le site plusieurs fois par jour.

Par sécurité, une prévision de plus de 48 heures est considérée comme périmée et n'est jamais affichée : le site retombe automatiquement sur le modèle statistique de secours plutôt que d'afficher un chiffre obsolète avec un niveau de confiance trompeur.

Le modèle de secours : trois approches statistiques combinées

Quand le modèle IA n'est pas disponible, le site calcule sa propre prévision à partir de trois méthodes classiques, combinées selon leur fiabilité récente :

  • Régression linéaire pondérée sur le cours du pétrole, avec un décalage temporel optimal (0 à 28 jours) déterminé par corrélation de Pearson : on cherche combien de jours mettent les variations du Brent à se répercuter sur les prix à la pompe, puis on prolonge la tendance en conséquence. Les données récentes comptent plus que les anciennes (pondération à décroissance exponentielle, demi-vie d'environ 35 jours).
  • Lissage exponentiel double (méthode de Holt), qui prolonge la tendance récente du prix lui-même, indépendamment du pétrole — utile quand le prix à la pompe suit une dynamique propre (ajustements de marge des distributeurs, par exemple).
  • Extrapolation naïve, une base de comparaison simple qui prolonge la tendance des deux dernières semaines.

Les trois prévisions sont ensuite combinées par pondération inverse de leur erreur historique (MAE) : le modèle qui s'est trompé le moins récemment pèse le plus dans le résultat final. Cette pondération est recalculée à chaque exécution, elle évolue donc naturellement dans le temps.

Niveaux de confiance

Chaque prévision est accompagnée d'un niveau de confiance (faible/moyen/élevé), calculé à partir de trois facteurs : la qualité d'ajustement du modèle sur les données passées (R²), la taille de l'échantillon disponible, et la volatilité récente du prix concerné. Un carburant dont le prix varie beaucoup ces derniers jours aura mécaniquement une confiance plus faible, même si le modèle sous-jacent est le même.

Limites et avertissement

Ces prévisions restent des estimations statistiques, pas des garanties : elles peuvent être mises en défaut par un évènement imprévisible (choc géopolitique, décision fiscale, rupture d'approvisionnement locale...). Elles sont recalculées chaque jour à partir des données les plus récentes disponibles, précisément pour intégrer ce type d'évènement dès qu'il commence à se refléter dans les prix ou dans le cours du pétrole.

Une question, un besoin de contexte pour un article ?

Journalistes, chercheurs ou simplement curieux : si vous voulez creuser un point de cette méthodologie ou avez besoin d'un chiffre précis à une date donnée, contactez-nous à [email protected].