En bref
Des systèmes RH et de paie mal alignés peuvent entraîner des incohérences dans les données. SQORUS a développé un modèle de machine learning capable de réconcilier automatiquement ces différentes sources avec une précision de 99,48 %.
Dans un contexte où les entreprises manipulent une multitude de systèmes RH (Core HR, paie, recrutement…), la consolidation de ces données pour une vision 360° de l’employé reste un défi majeur. Nous avons récemment relevé ce défi chez un de nos clients en développant une solution de machine learning, capable de faire le lien entre des sources hétérogènes même lorsqu’elles ne partagent pas la même granularité.
Problématique : des granularités incompatibles
Prenons un exemple concret :
- Le système Core HR stocke les données avec une granularité fine : person_number + assignment_number (représentant le poste occupé par l’employé).
- Le système de paie, en revanche, n’identifie les employés que via le person_number, sans référence à l’assignment_number.
Un même person_number peut donc correspondre à plusieurs affectations dans CoreHR. Comment savoir quelle ligne reflète la situation réelle en paie pour un mois donné ? Et que faire lorsqu’on a plusieurs lignes de paie sans assignment_number pour les différencier ?
Solution : un modèle de classification supervisée
Pour répondre à cette problématique, nous avons développé un modèle de machine learning supervisé, capable d’identifier automatiquement la bonne ligne d’assignment_number parmi les différentes possibilités.
Méthodologie :
1. Exploration et nettoyage des données pour harmoniser les champs clés : date d’embauche, intitulé de poste, division, service… autant de variables explicatives que possible.
2. Jointure naïve des sources : chaque ligne de paie est associée à l’état des assignments à la fin du mois, pour le même person_number.
3. Création d’un jeu de données labellisé servant de base d’entraînement :
- Si la date d’embauche dans la paie correspond à la date de début de l’assignment, on identifie la ligne comme correcte → label = 1
- Sinon, la ligne est considérée comme incorrecte → label = 0 4.
4. Séparation des données en ensembles d’apprentissage et de test.
5. Entraînement de plusieurs modèles via une validation croisée à 5 couches et 10 itérations.
6. Sélection du modèle le plus performant selon les métriques (accuracy, F1-score) et une validation métier par les équipes RH.
Modèle retenu :
- SVM (Support Vector Machine) avec un noyau radial (RBF)
- Performances :
- Accuracy : 99,48 %
- Balanced Accuracy : 99,10 %
- F1-score : 0,99
Architecture de la solution
L’ensemble de la solution est déployé et automatisé sur un environnement Microsoft Azure, permettant une mise à jour régulière à l’arrivée de nouvelles données.
- Intégration des données depuis les bases paie et RH (YES CoreHR)
- Transformation : nettoyage, enrichissement et génération de variables explicatives
- Modélisation et prédiction de la bonne ligne assignment_number à l’aide du modèle ML
- Alimentation d’un datamodel utilisé dans Power BI pour des dashboards RH fiables et enrichis
Un repository central est également mis à jour, validé par les équipes RH, pour corriger les éventuelles anomalies détectées.
Bénéfices observés
- Analyse inter-systèmes facilitée
- Vision RH consolidée et précise pour les équipes décisionnelles
- Automatisation d’un processus auparavant manuel et sujet à erreur
- Gain de temps significatif pour les équipes RH
Cas d’usage concrets pour vos données RH
Le cas décrit ici peut être généralisé à d’autres problématiques RH :
- Analyse enrichie Paie/RH : comprendre les écarts de rémunération en fonction des affectations réelles
- Performance & rémunération : identifier les liens entre performance individuelle et paie
- Bien-être au travail : croiser absentéisme, performance et données RH pour détecter les signaux faibles
- Stratégie de recrutement : analyser le parcours candidat jusqu’à sa stabilisation dans l’entreprise
Cette méthode peut être adaptée à toute combinaison de systèmes RH disposant d’un identifiant commun, comme ici le person_number.
Réconcilier ses données RH grâce au machine learning
Ce projet illustre la manière dont l’IA peut répondre à des enjeux concrets de qualité et d’intégration des données RH.
Grâce à ce modèle de machine learning, nous sommes désormais capables de croiser des sources auparavant non réconciliables qui offre à nos clients une base solide pour une data RH fiable, scalable et actionnable.
Stratégie Data RH : et si on accélérait ?
Imaginez un monde où la fonction RH est propulsée dans une nouvelle dimension grâce à la puissance de la data. Et si ce monde était à portée de main ? Découvrez comment exploiter tout le potentiel de la Data RH pour révolutionner votre organisation.
Contact
Un projet ? Une demande ? Des questions ?
Contactez-nous dès aujourd’hui et découvrez comment nous pouvons concrétiser ensemble l’avenir du numérique de votre entreprise.
FAQ
Pourquoi les données RH sont-elles si difficiles à consolider entre systèmes ?
Chaque système RH a sa propre logique de structuration des données. Le Core HR identifie un employé par son poste (assignment_number), la paie par son identifiant personnel (person_number). Ces granularités différentes créent des incompatibilités qui rendent la consolidation manuelle fastidieuse et sujette à erreurs. Le machine learning permet d'automatiser cette réconciliation avec une précision bien supérieure à ce qu'un traitement manuel peut offrir.
Quels systèmes RH peuvent bénéficier de cette approche ?
Cette méthode s'applique à toute combinaison de systèmes RH partageant un identifiant commun (Core HR, paie, recrutement, formation...) Elle est compatible avec les principaux SIRH du marché : Oracle HCM, SAP SuccessFactors, Workday, ADP. La seule condition est de disposer d'un identifiant commun entre les systèmes ainsi que d'un historique de données suffisant pour entraîner le modèle.
Combien de temps faut-il pour déployer ce type de solution ?
Le délai dépend principalement de la qualité et du volume des données disponibles. En général, il faut compter 2 à 4 semaines pour explorer et préparer les données, 1 à 2 semaines pour entraîner le modèle, puis environ 1 semaine pour le déployer sur Azure. Le principal facteur de réussite reste la qualité du travail réalisé en amont : sélectionner les bonnes variables et disposer d'un jeu de données fiable pour l'entraînement.



