Comprendre la donnée synthétique depuis zéro.

Ce qu'est la donnée synthétique, comment on la fabrique, et comment on la valide — en clair. Tout le projet tient en trois verbes : générer, valider, apprendre.

L'idée en un paragraphe

Certaines données précieuses ne peuvent pas être partagées — elles contiennent des informations personnelles ou bancaires. La donnée synthétique est inventée par un programme pour ressembler statistiquement à la vraie sans décrire personne de réel. Pour la fraude, on va plus loin : aucune donnée réelle n'est utilisée. Un générateur de règles produit des données de départ plausibles et déjà synthétiques, qu'un modèle apprend ensuite à imiter. Rien de réel n'entre jamais dans le pipeline.

Vocabulaire essentiel

TermeEn clair
datasetUn tableau. Chaque ligne = un exemple (une transaction) ; chaque colonne = une caractéristique.
tabulaireEn forme de tableau (lignes × colonnes), comme un tableur.
featureUne colonne utilisée pour prédire — ex. montant, pays, heure.
label / cibleLa colonne à prédire. Ici : is_fraud.
marginaleLa distribution d'une seule colonne prise isolément.
corrélationUn lien statistique entre deux colonnes.
copuleLe « moteur » qui imite un tableau en séparant deux choses : la forme de chaque colonne (marginales) et la façon dont les colonnes varient ensemble (corrélations).
déséquilibre de classesQuand une catégorie est rare — la fraude ≈ 0,5 % des transactions.
typologieUne famille de fraude avec sa signature (card-testing, prise de compte…), étiquetée dans fraud_type.
non-stationnaritéLes motifs dérivent — la fraude d'hier n'est pas celle de demain. Aucun jeu figé n'est jamais « à jour ».

1 · Générer

On produit des transactions réalistes à deux niveaux. Entre classes, la fraude décale les marginales : montants plus élevés ou atypiques, heures nocturnes, carte non présentée, géographies étrangères, rafales. À l'intérieur d'une classe, les colonnes sont corrélées, pas indépendantes — un gros montant va avec certains marchands ; un achat en personne se fait près de chez soi. Ces liens inter-features sont ce qu'un modèle de fraude apprend réellement.

Une copule gaussienne apprend cette structure et la reproduit. On ajuste une copule par typologie et on les recombine à un taux cible exact, pour ne pas noyer le signal minoritaire de fraude et pour que chaque typologie garde sa signature.

2 · Valider

Un dataset synthétique ne vaut que s'il passe trois tests. On les automatise en barrières de qualité — un échec et rien n'est publié.

  • Fidélité — le synthétique colle-t-il aux statistiques de départ (marginales et corrélations) ? Agrégé en quality_score (≈0,85 ; seuil ≥0,72).
  • Confidentialité — évite-t-il de recopier les lignes de départ ? privacy_score = 1,00 (aucune copie).
  • Utilité — un modèle peut-il réellement apprendre dessus ? Le test le plus honnête.

3 · Apprendre

C'est le point de vue de l'acheteur : entraîner un détecteur, puis le mesurer. Comme la fraude est rare, le « pourcentage de bonnes réponses » est inutile (toujours dire « pas de fraude » donne 99,5 %). On utilise plutôt l'AUC ROC et la PR-AUC — indépendantes du seuil, robustes au déséquilibre.

Chaque dataset livre un baseline reproductible (LogReg + gradient boosting). Le point clé : une AUC globale élevée, mais une AUC nettement plus basse sur les typologies dures — la preuve mesurable que le dataset contient de vrais cas frontières.

0.945
ROC-AUC · global
0.72
counterfeit_present
0.66
friendly_fraud

La datasheet, anatomie de la confiance

Chaque dataset livre le même gabarit fixe de datasheet (d'après la discipline « datasheets for datasets »). La cohérence est le but — un acheteur reconnaît un dataset Plexoria à sa datasheet.

RubriqueCe qu'elle contient
Scope — à lire d'abordCe que le dataset est / n'est pas, avec l'avertissement de portée.
MéthodeSeed, synthèse par copule et par typologie, taux/mix par construction.
ProvenanceGénérateur RNG, aucune donnée réelle, pins de reproductibilité.
Dictionnaire des donnéesColonne par colonne, dont is_fraud et fraud_type.
Typologies de fraudeType (visible / dur), part, effectif, description.
Réalisme & non-stationnaritéEmpreintes statistiques, domaine adversarial, régénérable.
Scores qualité & confidentialitéLes chiffres QC mesurés.
Benchmark baselineAUC globale + par typologie.
IntégritéManifest SHA-256 + signature Ed25519, et comment vérifier.