Technologies

Les biais algorithmiques reproduisent les discriminations sociales dans les logiciels de recrutement

Written by

Comment les biais algorithmiques s’installent dans les logiciels de recrutement


Un logiciel de recrutement peut sembler appliquer des critères identiques à tous les candidats. Pourtant, ses résultats dépendent des données et des choix humains qui ont servi à le concevoir, le paramétrer et l’évaluer. Quand ces éléments reflètent des pratiques inéquitables, l’automatisation risque de transformer des préférences anciennes en règles apparemment objectives.


Imaginons Nadia, ingénieure expérimentée qui postule dans une entreprise utilisant des algorithmes de sélection. Son dossier est comparé à des profils auparavant embauchés, et le système repère des ressemblances entre les candidatures retenues. Si l’entreprise a historiquement recruté surtout des hommes, ces ressemblances peuvent défavoriser Nadia, même si le logiciel ne demande jamais son genre.


Données biaisées et apprentissage historique


La première source de biais tient souvent aux exemples fournis au modèle. Un système entraîné sur d’anciens CV et décisions d’embauche apprend à reproduire les régularités qu’il détecte, sans distinguer automatiquement une compétence réelle d’une convention sociale. Si certains profils ont été moins souvent recrutés par le passé, ils apparaissent moins fréquemment parmi les exemples positifs.


Le modèle peut ensuite associer la réussite à des indices indirects : parcours universitaire, interruptions de carrière, vocabulaire d’un CV ou proximité avec les salariés déjà en poste. Une variable sensible supprimée ne suffit pas à garantir l’équité, car d’autres informations peuvent jouer un rôle de substitut. Le code ne copie donc pas seulement les données ; il traduit aussi les choix faits pour définir ce qu’est un candidat « performant ».


Selon le cas documenté d’Amazon, l’outil expérimental conçu pour évaluer des candidatures techniques a été entraîné sur des CV historiques où les hommes étaient majoritaires parmi les recrutements. Le système a pénalisé certains indices associés aux femmes, puis le projet a été abandonné en 2017, faute de garantie suffisante contre des discriminations indirectes. Cette histoire illustre une difficulté centrale : corriger un mot repéré ne corrige pas nécessairement la logique apprise.


Une équipe RH peut aussi confondre la performance passée du modèle avec sa justesse. Si les anciennes décisions favorisaient certains profils, prédire qui aurait été retenu revient à reproduire cette préférence, et non à mesurer objectivement le potentiel professionnel. Une donnée abondante n’est pas forcément une donnée représentative : dix années de dossiers peuvent documenter avec précision une pratique injuste.


Pour comprendre les sources possibles, il faut examiner à la fois la collecte, la représentation des candidats et les critères choisis avant l’entraînement.


Origines fréquentes des biais :


  • Historique d’embauche peu représentatif des compétences recherchées
  • Profils sous-représentés ou absents des données d’entraînement
  • Critères indirects liés au genre, à l’origine ou au milieu social
  • Indicateurs de réussite définis sans examen des discriminations passées

Biais de genre et critères indirects


Le biais de genre ne se limite pas à une variable indiquant explicitement si une personne est une femme ou un homme. Il peut se glisser dans des formulations, des trajectoires professionnelles ou des établissements associés à un genre. Un système qui classe les candidatures selon leur ressemblance avec des profils valorisés peut donc pénaliser des personnes sans jamais consulter une donnée explicitement sensible.

A lire également :  Les cookies tiers pistent le comportement de navigation des internautes

La discrimination peut également apparaître dans le filtrage initial. Un outil de tri qui privilégie certains mots-clés risque d’écarter des candidatures décrivant autrement une même compétence, notamment lorsque les parcours diffèrent des profils habituels. Si le rejet intervient avant l’examen humain, le candidat ne sait pas nécessairement qu’un classement automatisé a pesé dans la décision.


Pour Nadia, un indicateur apparemment neutre comme la continuité de carrière pourrait réduire son score après une interruption professionnelle, même si celle-ci n’a aucun rapport avec sa capacité à accomplir le travail. L’enjeu n’est pas d’interdire toute donnée, mais de vérifier son lien réel avec les tâches du poste et ses effets sur différents groupes. Cette vérification ouvre la question des conséquences concrètes pour les personnes candidates.

Discrimination dans le recrutement : des erreurs aux effets réels


Lorsque des données ou des critères biaisés influencent le classement, les conséquences quittent l’écran pour atteindre les parcours professionnels. Un score peut déterminer qui reçoit un entretien, qui passe une évaluation complémentaire et qui disparaît du processus sans explication compréhensible. Cette concentration des décisions rend les erreurs plus difficiles à repérer, surtout quand le système traite de nombreuses candidatures.


Le tri automatisé peut fermer des portes


Dans un recrutement classique, un candidat peut parfois demander pourquoi son dossier n’a pas été retenu, même si la réponse reste sommaire. Avec un classement automatisé, plusieurs étapes se superposent : extraction des informations, notation, seuil de sélection et recommandation au recruteur. Une faiblesse à l’une de ces étapes peut suffire à faire disparaître un profil compétent avant toute conversation.


Un logiciel peut analyser un CV, une vidéo d’entretien ou un questionnaire, mais la pertinence de ces outils dépend de la fonction réelle des indicateurs mesurés. Une expression faciale ou une façon de parler ne constitue pas automatiquement une mesure fiable de la compétence. Quand les critères favorisent certaines manières de se présenter, les personnes ayant d’autres habitudes culturelles ou des situations de handicap peuvent être désavantagées.


Selon les informations publiées par ProPublica sur COMPAS, outil utilisé dans le système pénal américain, des personnes noires ont été plus souvent classées à tort comme présentant un risque élevé que des personnes blanches. Ce cas ne concerne pas le recrutement, mais il montre combien les choix de données et de seuils peuvent produire des effets discriminatoires dans un domaine sensible. Il rappelle également qu’un score n’est pas une vérité indépendante de son contexte d’utilisation.


Dans l’emploi, un effet de série peut amplifier le problème : les profils sélectionnés passent davantage d’entretiens, accumulent des évaluations positives et deviennent de nouvelles références pour le système. Les personnes écartées, elles, laissent moins de traces utiles pour mesurer ce que l’outil a manqué. Le résultat peut alors sembler confirmer le classement initial, alors que le processus a lui-même limité les occasions de réussite.


Inégalités sociales et discrimination raciale


Les inégalités sociales influencent l’accès aux formations, aux réseaux professionnels et aux expériences valorisées dans un CV. Un algorithme qui privilégie les établissements les plus représentés dans son historique peut donc transformer un avantage déjà acquis en critère de sélection supplémentaire. Les candidats compétents issus de parcours moins conventionnels risquent d’être moins bien classés, même lorsque leurs aptitudes correspondent au poste.


La discrimination raciale peut, elle aussi, être produite par des variables de substitution, des données incomplètes ou des règles de classement. Le nom, l’adresse ou certaines étapes de parcours peuvent être corrélés à l’origine perçue, sans que ces éléments mesurent la capacité professionnelle. Cette corrélation ne prouve pas à elle seule une intention discriminatoire, mais elle justifie un examen sérieux des résultats selon les groupes concernés.


A lire également :  Tech et inclusion : comment rendre l’innovation accessible à tous ?

Selon l’analyse de ProPublica sur COMPAS, l’outil a aussi sous-estimé le risque pour des personnes blanches dans les comparaisons rapportées. Cette différence illustre pourquoi une moyenne générale ne suffit pas : un modèle peut afficher des résultats globalement acceptables tout en commettant des erreurs très différentes d’un groupe à l’autre. Dans le recrutement, il faut donc regarder qui est rejeté à tort, qui est retenu à tort et à quel stade se creusent les écarts.


Les cas documentés permettent de distinguer la nature du problème et les contrôles nécessaires avant toute décision de déploiement.


Risques selon le mécanisme :


Mécanisme observé Effet possible Contrôle utile
Historique d’embauche déséquilibré Reproduction des profils déjà favorisés Comparer les résultats aux compétences du poste
Critères indirects sensibles Écart de classement entre groupes Tester l’effet des variables et de leurs substituts
Filtrage précoce automatisé Rejet sans examen humain approfondi Vérifier les rejets et prévoir un recours
Réentraînement sur les choix passés Renforcement des décisions initiales Évaluer les effets au fil des campagnes


Pour prévenir ces effets, l’entreprise doit auditer tout le parcours de sélection, et non seulement la formule de classement.

Auditer les algorithmes de sélection avant et pendant leur usage


Après avoir identifié les effets possibles, l’étape suivante consiste à vérifier comment ils apparaissent dans un système concret. Un audit ne se réduit pas à une validation technique réalisée avant le lancement : il doit examiner les données, les critères, les résultats et les procédures humaines associées. Sans accès suffisant à ces éléments, l’entreprise risque de confondre conformité apparente et équité réelle.


Mesurer les résultats par groupe


Un contrôle utile compare plusieurs étapes du recrutement : taux de présélection, invitations à un entretien, réussite aux tests et décisions finales. Des différences entre groupes ne démontrent pas toujours une discrimination, mais elles constituent un signal qui mérite une enquête. Il faut alors rechercher si l’écart vient des données, de la conception de l’outil, des critères liés au poste ou de pratiques internes.


Les équipes doivent aussi examiner les faux positifs et les faux négatifs. Un faux négatif correspond ici à une candidature pertinente rejetée par l’outil ; un faux positif, à une candidature recommandée malgré une inadéquation avec les critères professionnels définis. Les deux erreurs ont des effets distincts : la première prive une personne d’une possibilité, tandis que la seconde peut dégrader la qualité de la sélection et miner la confiance des recruteurs.


Selon les travaux de Kristian Lum et William Isaac sur la police prédictive à Oakland, des données historiques de contrôle peuvent faire apparaître comme plus risquées des zones davantage surveillées. Le mécanisme est instructif pour l’emploi : les décisions de départ déterminent les données observées ensuite, et ces données peuvent renforcer le classement initial. Un audit doit donc étudier la boucle de rétroaction, pas seulement la photographie des résultats à une date donnée.


Les tests doivent être répétés lorsque l’entreprise change de poste, de bassin de candidatures ou de fournisseur. Un modèle acceptable pour un métier ne l’est pas automatiquement pour un autre, puisque les compétences, les parcours et les critères pertinents diffèrent. Il faut consigner les versions du système et les changements apportés pour pouvoir comprendre une évolution des résultats.

Documenter les critères et garder une décision humaine


Un audit sérieux commence par une question simple : chaque variable aide-t-elle réellement à évaluer une compétence requise ? Si la réponse est floue, le critère mérite d’être retiré ou justifié avant de produire des effets sur les candidatures. L’entreprise doit également savoir quelles données sont collectées, combien de temps elles sont conservées et qui peut accéder aux résultats.


A lire également :  Cybersécurité : comment protéger ses données personnelles

La présence d’un recruteur dans le circuit ne suffit pas à garantir un contrôle humain. Si celui-ci suit presque toujours la recommandation affichée, l’intervention reste formelle. Une procédure robuste permet de contester un classement, de vérifier les dossiers écartés et de documenter les raisons professionnelles d’une décision contraire à l’outil.


Les audits gagnent à réunir des profils variés : spécialistes des ressources humaines, juristes, personnes techniques et représentants des publics concernés. Une équipe diversifiée peut repérer des usages ou des conséquences qui échappent à un groupe homogène. Elle ne garantit pas l’absence de biais, mais augmente les chances de détecter des angles morts avant qu’ils ne deviennent des pratiques ordinaires.


Points à vérifier lors d’un audit :


  • Pertinence des variables par rapport aux missions du poste
  • Écarts de sélection entre groupes à chaque étape
  • Traçabilité des versions, seuils et recommandations produites
  • Procédure accessible de réexamen pour les candidatures écartées

Une fois ces contrôles organisés, l’entreprise peut décider si l’outil est acceptable, doit être corrigé ou ne doit pas être utilisé.

Réduire les biais algorithmiques par une gouvernance responsable


Les audits n’ont de portée que si leurs constats entraînent des décisions concrètes. L’entreprise peut améliorer les données, modifier les critères, limiter l’automatisation ou abandonner un outil dont les risques restent trop élevés. Cette gouvernance doit répartir clairement les responsabilités entre le fournisseur du logiciel et l’employeur qui l’utilise.


Corriger les données sans masquer les écarts


Les mesures techniques interviennent à plusieurs moments : avant l’entraînement, pendant l’apprentissage ou après la production des scores. Le prétraitement peut corriger des déséquilibres de représentation ; des méthodes intégrées à l’entraînement peuvent limiter certains écarts ; un post-traitement peut ajuster des sorties. Aucune méthode ne résout tous les problèmes, et chacune dépend de la définition retenue pour mesurer l’équité.


Il faut donc éviter de présenter un ajustement statistique comme une garantie universelle. Réduire un écart sur une mesure peut en accentuer un autre, notamment si les critères d’équité choisis ne sont pas compatibles entre eux. Les équipes doivent expliciter les arbitrages, tester les effets sur des situations représentatives et faire examiner les résultats par des personnes compétentes.


La qualité des données compte autant que leur volume. Les dossiers doivent représenter les parcours susceptibles d’être examinés et documenter les limites connues de la collecte. Toutefois, recueillir des informations sensibles pour mesurer des écarts exige un encadrement juridique et des garanties de confidentialité ; le besoin de contrôle ne justifie pas une collecte illimitée.


Les équipes de développement et les responsables RH doivent aussi confronter leurs hypothèses aux expériences des personnes candidates. Cette consultation peut révéler qu’un critère présenté comme neutre pénalise certains parcours sans rapport avec le poste. La diversité des équipes aide à poser de meilleures questions, mais elle ne remplace ni les tests, ni la documentation, ni les mécanismes de recours.


Transparence, responsabilités et cadre européen


Dans l’Union européenne, l’AI Act adopté en 2024 encadre les systèmes d’intelligence artificielle selon les risques associés à leurs usages. Les outils destinés à des décisions liées à l’emploi relèvent d’exigences renforcées prévues pour les systèmes à haut risque, sous réserve des catégories et conditions définies par le règlement. Pour une entreprise, cela implique de ne pas traiter l’achat d’un logiciel comme une simple opération informatique.


La transparence utile ne consiste pas seulement à informer qu’un algorithme existe. Les personnes concernées doivent pouvoir comprendre le rôle de l’outil dans le processus et disposer d’un moyen de signaler une erreur ou de demander un examen. Les recruteurs, eux, ont besoin d’explications opérationnelles sur les critères, les limites et les situations où une recommandation ne doit pas être suivie.


Le contrat avec un fournisseur devrait préciser les données utilisées, les modalités de contrôle, les mises à jour et les responsabilités en cas de problème. L’employeur reste en mesure d’influencer l’impact du système par ses seuils, ses procédures et sa façon d’interpréter les scores. Acheter un outil « prêt à l’emploi » ne transfère donc pas mécaniquement toute responsabilité au vendeur.


Repères de gouvernance pour l’employeur :


  • Finalité documentée et critères directement liés au poste
  • Évaluation des écarts avant chaque déploiement important
  • Information compréhensible pour les candidats concernés
  • Réexamen humain et responsabilité interne clairement attribuée

La gouvernance doit rester active après le lancement : les postes évoluent, les données changent et les modèles sont parfois mis à jour. Une entreprise qui surveille les résultats peut suspendre un système lorsque les écarts deviennent préoccupants, puis vérifier les corrections avant sa remise en service. Dans le recrutement, l’équité se construit ainsi par des choix vérifiables, une vigilance continue et la possibilité réelle de contester une décision.

Laisser un commentaire