
Z-score
Définition, calcul et usages en data marketing
Le Z-score, également appelé score standard, est une mesure statistique qui indique à quelle distance une valeur se situe de la moyenne d’un ensemble de données, cette distance étant exprimée en nombre d’écarts-types. Il permet ainsi de comparer des valeurs qui n’utilisent pas nécessairement la même échelle et, surtout, de repérer celles qui s’éloignent fortement du comportement habituel. Le NIST le définit, dans sa forme classique sur un échantillon, par la différence entre une observation et la moyenne, divisée par l’écart-type.
À première vue, le Z-score appartient davantage aux statistiques qu’au marketing. Pourtant, avec la généralisation de la data marketing, du scoring, de la personnalisation, de la détection d’anomalies et du machine learning, il apparaît dans de nombreux traitements utilisés par les plateformes MarTech.

Comment fonctionne un Z-score ?
Le principe est relativement simple. On considère un ensemble de valeurs possédant une moyenne et un écart-type. Pour une valeur donnée x, le Z-score s’écrit généralement :
Z = (x − μ) / σ
où x représente la valeur observée, μ la moyenne et σ l’écart-type. Pour un échantillon, on rencontre également la notation utilisant la moyenne \bar{x} et l’écart-type s.
Le résultat n’est donc pas exprimé en euros, en visites, en clics ou en commandes, mais en nombre d’écarts-types par rapport à la moyenne.
Un Z-score de 0 signifie que la valeur est égale à la moyenne. Un score de +1 indique qu’elle se trouve un écart-type au-dessus de la moyenne ; −1, un écart-type en dessous. Un score de +2,5 correspond à une valeur située 2,5 écarts-types au-dessus de la moyenne.
Prenons un exemple MarTech très simple. Supposons que les clients d’un site e-commerce dépensent en moyenne 100 € par commande, avec un écart-type de 20 €. Un client passe une commande de 160 € :
Z = (160 − 100) / 20 = 3
Sa commande se situe donc trois écarts-types au-dessus de la moyenne.
Le Z-score ne dit pas que cette commande est « bonne » ou « mauvaise ». Il indique simplement qu’elle est statistiquement très éloignée du comportement moyen observé.
Pourquoi standardiser les données ?
L’un des principaux intérêts du Z-score est de rendre des données différentes comparables sur une même échelle statistique.
Imaginez qu’une plateforme marketing cherche à identifier ses clients les plus engagés. Elle dispose du nombre de visites mensuelles, du montant des achats, du nombre d’e-mails ouverts et du temps passé sur le site.
Ces indicateurs sont exprimés dans des unités complètement différentes. Comparer directement 12 visites, 450 € d’achats et 8 ouvertures d’e-mails n’aurait guère de sens.
En transformant ces différentes variables en Z-scores, la plateforme peut raisonner en termes d’écart par rapport au comportement moyen. Un client peut ainsi être à +2 écarts-types sur le montant dépensé, +1,3 sur la fréquence de visite et −0,5 sur l’ouverture des e-mails.
Cette standardisation est particulièrement utile avant certains calculs statistiques ou traitements de machine learning, lorsque les différences d’échelle entre variables risqueraient d’influencer les résultats.
Le Z-score en marketing et MarTech
Dans un environnement MarTech, le Z-score peut intervenir de façon assez discrète : l’utilisateur d’une plateforme n’a pas nécessairement conscience qu’un algorithme l’utilise.
Un premier usage concerne le scoring client. Les comportements individuels peuvent être comparés aux comportements moyens d’une population. Fréquence d’achat, panier moyen, récence, engagement ou consommation d’un service peuvent ainsi être standardisés avant d’être combinés dans un score plus élaboré.
Le Z-score peut également servir à la segmentation. Plutôt que de définir arbitrairement qu’un « gros acheteur » dépense plus de 1 000 €, on peut chercher les clients dont les dépenses se situent, par exemple, nettement au-dessus de celles de la population étudiée. Le seuil devient alors relatif au comportement observé plutôt qu’à une valeur absolue.
Autre domaine particulièrement intéressant : la détection d’anomalies. Un pic de trafic, une chute brutale du taux de conversion, une augmentation inhabituelle des commandes ou une variation anormale d’un KPI peuvent être repérés en mesurant leur éloignement par rapport à un comportement de référence. La détection d’anomalies consiste précisément à identifier des observations qui s’écartent de ce qui est habituel ou attendu.
Cette logique se retrouve aussi dans le monitoring des plateformes Cloud et MarTech. Un nombre de requêtes API inhabituel, une augmentation du temps de réponse ou une variation soudaine du volume de données traité peut déclencher une alerte. Des systèmes actuels de détection d’anomalies utilisent effectivement des méthodes fondées sur l’écart-type, dont le Z-score.
Z-score et détection des valeurs aberrantes
Le Z-score est souvent associé à la recherche des outliers, c’est-à-dire des valeurs très éloignées du reste des observations.
Avec des données dont la distribution est approximativement normale, une valeur située à plusieurs écarts-types de la moyenne mérite naturellement l’attention. On rencontre ainsi fréquemment des règles pratiques reposant sur des valeurs absolues de Z supérieures à 2 ou 3.
Mais attention à une simplification fréquente : un Z-score élevé ne signifie pas automatiquement qu’une donnée est erronée.
Une commande exceptionnellement élevée peut provenir d’une fraude… ou d’un excellent client. Un pic de trafic peut révéler une attaque automatisée… ou le succès inattendu d’une campagne. Une hausse exceptionnelle des conversions peut être liée à une erreur de tracking… ou à une promotion particulièrement performante.
Le Z-score signale l’exception ; il ne l’explique pas.
Le NIST souligne par ailleurs que l’utilisation mécanique des Z-scores pour identifier les valeurs aberrantes peut être trompeuse, notamment avec de petits échantillons.
Z-score et distribution normale
Le Z-score est souvent enseigné conjointement avec la loi normale, la fameuse courbe « en cloche ». Cette association est utile, mais elle entraîne parfois une confusion.
Il est possible de calculer un Z-score sans que les données suivent une distribution normale. Le calcul ne nécessite que la moyenne et l’écart-type appropriés. En revanche, interpréter un Z-score comme une probabilité ou utiliser certaines règles statistiques liées aux valeurs de ±1, ±2 ou ±3 suppose davantage d’hypothèses sur la distribution.
Cette distinction est importante en marketing, car les données comportementales sont loin d’être toujours normalement distribuées. Les montants d’achat, par exemple, peuvent présenter une longue traîne constituée d’un petit nombre de très gros clients.
Dans ce type de situation, la moyenne et l’écart-type peuvent eux-mêmes être fortement influencés par les valeurs extrêmes.
Le Z-score modifié
Lorsque les données comportent beaucoup de valeurs extrêmes, une alternative est le Modified Z-score.
Au lieu de s’appuyer simplement sur la moyenne et l’écart-type, il peut utiliser des statistiques plus robustes telles que la médiane et la Median Absolute Deviation (MAD). Cette approche est moins sensible aux outliers eux-mêmes. IBM souligne ainsi que le Z-score modifié peut être plus robuste que le Z-score standard parce que son calcul basé sur la médiane est moins influencé par les valeurs extrêmes.
Pour certaines données marketing très asymétriques ou comportant naturellement des comportements exceptionnels, cette distinction peut devenir importante.
Quelle différence entre Z-score, scoring et score prédictif ?
Le mot « score » peut prêter à confusion dans l’univers MarTech.
Un Z-score est une mesure statistique standardisée. Il décrit la position relative d’une observation par rapport à une distribution de données.
Un score marketing est généralement une construction métier : score d’engagement, lead scoring, score d’appétence, score de fidélité, risque de churn, etc. Il peut combiner de nombreux indicateurs selon des règles déterminées par l’entreprise.
Enfin, un score prédictif est généralement produit par un modèle statistique ou de machine learning afin d’estimer une probabilité ou un comportement futur.
Ces notions ne sont pas incompatibles : des Z-scores peuvent parfaitement devenir des variables utilisées dans le calcul d’un score marketing ou comme données d’entrée d’un modèle prédictif.
Les limites du Z-score en MarTech
Le principal danger consiste à donner au Z-score davantage de sens qu’il n’en possède réellement. Il mesure une distance statistique, pas la valeur marketing d’un individu ni la cause d’un comportement.
Il est également sensible à la population de référence. Un client peut apparaître exceptionnel lorsqu’il est comparé à l’ensemble des clients, mais parfaitement ordinaire au sein de son segment. Le choix de la baseline est donc essentiel.
Enfin, le marketing manipule souvent des distributions asymétriques, saisonnières ou évolutives. Comparer le trafic du Black Friday au trafic moyen annuel risque, par exemple, de produire une anomalie statistiquement spectaculaire… mais parfaitement prévisible commercialement.
Dans un environnement MarTech moderne, le Z-score est donc souvent une brique du raisonnement plutôt qu’une conclusion.
À retenir
Le Z-score mesure l’écart d’une valeur à la moyenne en nombre d’écarts-types. Une valeur de 0 correspond à la moyenne, une valeur positive se situe au-dessus et une valeur négative en dessous.
Simple à calculer, il permet de standardiser des données, comparer des observations, alimenter des scores et détecter des comportements inhabituels. Ces propriétés expliquent son utilisation en data marketing, analytics, machine learning et monitoring des infrastructures Cloud.
Son apparente simplicité ne doit cependant pas conduire à l’utiliser comme un détecteur universel d’anomalies. Un comportement statistiquement inhabituel n’est pas nécessairement anormal d’un point de vue marketing. Et c’est précisément là que l’analyse métier reprend ses droits.
Quelques références
- « What Is Anomaly Detection? » IBM — IBM — IBM Think — décembre 2023
- « Exploratory Data Analysis — Detection of Outliers » NIST/SEMATECH e-Handbook of Statistical Methods — NIST / SEMATECH — NIST Engineering Statistics Handbook
- « Anomaly Detection in Machine Learning » IBM — Camilo Quiroz-Vázquez — IBM Think — décembre 2023
- « Anomaly Detection Algorithm » IBM SPSS Algorithms Guide — IBM — Algorithms Guide
- « Modified Z score » IBM Cognos Analytics — Dashboards and Stories User Guide — IBM — Cognos Analytics User Guide















