Retour aux projets

AJC / DATA · NLP · BUSINESS INTELLIGENCE

AJC — Data, matching & Power BI

Mission Data/IA appliquée au recrutement et à la formation : traitement de plus de 56 000 CV en production, matching explicable par compétences, consolidation de plusieurs sources métier et restitution dans Power BI.

  • Python
  • pandas
  • OCR
  • NLP
  • Power BI
  • Docker
  • Beetween
Période
2023–2024
Type
Data · NLP · Business Intelligence
Rôle
Conception & développement Data/IA
Contexte
Recrutement & formation

VUE D’ENSEMBLE

Comprendre la mission

Contexte

Les équipes recrutement et formation exploitaient des CV hétérogènes et plusieurs sources métier distinctes. L’enjeu était à la fois de faciliter la recherche de profils et de consolider les données nécessaires au pilotage.

Objectif

Automatiser le traitement des CV, produire un matching transparent par filière ou compétences et fiabiliser les données de recrutement avant leur restitution dans des dashboards Power BI.

Notre rôle

Développer les pipelines Python de préparation et matching, les traitements OCR/NLP, la consolidation multi-source, l’automatisation Docker/SSH et la construction ou l’évolution des rapports Power BI.

Résultat

Une chaîne de traitement utilisée sur plus de 56 000 CV en production, complétée par des outils de scoring explicables et des indicateurs opérationnels pour les équipes métier.

VOLET 01 · MATCHING CV

Du CV brut au score explicable

Le pipeline transforme des documents hétérogènes en représentations textuelles normalisées, puis rapproche chaque CV d’un vocabulaire métier issu des filières et modules.

Architecture simplifiée du volet Matching CV : préparation documentaire, normalisation métier, matrices de présence et scoring pondéré.

REPÈRES

Une chaîne conçue pour l’usage métier

56 000+ CV Documents traités dans l’usage production.
1 253 tokens État documenté du vocabulaire métier après tagging.
2 scores Matching booléen et scoring pondéré explicable.
3 sources métier Beetween, Quest et NoCRM pour le pilotage Data/BI.

DÉTAILS TECHNIQUES

Architecture et mise en œuvre

Les deux volets partagent une même logique : transformer des données métier hétérogènes en informations plus simples à rechercher, comparer et piloter.

NLP · REFERENTIEL

Normalisation & matching explicable

  • Construction du vocabulaire métier à partir des filières et modules de formation.
  • Normalisation de la casse, des accents, caractères spéciaux, fautes connues et stop words.
  • Dictionnaire de variantes permettant de ramener plusieurs formes vers des tags canoniques.
  • Tokenisation des CV et calcul de fréquences.
  • Matrice booléenne CV × tokens puis application de poids pour produire un score plus discriminant.
  • Recherche par identifiant de filière ou directement par liste de mots-clés.

DOCUMENT · OCR

Traitement documentaire multi-format

  • Prise en charge historique de PDF, images, DOC et DOCX.
  • OCR avec Tesseract, Pillow et pdf2image.
  • Conversion documentaire en amont lorsque le contenu n’est pas directement exploitable.
  • Préservation de certains tokens techniques tels que C++ ou .NET.
  • Une migration ultérieure vers LibreOffice/SSH est documentée, mais son code refactorisé n’est pas inclus dans le kit analysé.

DATA · AUTOMATION

Pipeline multi-source & industrialisation

  • Consolidation de données issues de Beetween, Quest et NoCRM.
  • Traitements Python/pandas pour filtrer, typer, renommer et préparer les données.
  • Contrôles de structure sur les CSV avant consommation par la couche BI.
  • Exécution sur serveur SSH et conteneurisation Docker.
  • Orchestration séquentielle des traitements Quest, NoCRM puis alimentation de l’écosystème utilisé par Power BI.
  • Actualisation quotidienne observée dans les scripts d’orchestration.

BI · RESTITUTION

Dashboards & KPI métier

  • Reporting Power BI pour le recrutement par filière et par collaborateur.
  • Suivi du funnel : candidats entrants, qualifications, entretiens et entrées en formation.
  • Calcul et visualisation de taux de transformation.
  • Tableau de bord commercial autour du chiffre d’affaires signé et des leads.
  • Segmentation temporelle et filtres métiers adaptés aux usages opérationnels.
  • Les fichiers PBIX contenant potentiellement des données internes restent volontairement privés.

VOLET 02 · DATA & POWER BI

Des sources métier aux KPI de pilotage

Le second volet consolide les données opérationnelles, contrôle leur qualité et automatise leur préparation avant restitution dans Power BI.

Chaîne de collecte, préparation et automatisation alimentant les usages de pilotage Power BI.

STACK

Technologies utilisées

  • Python
  • pandas
  • NumPy
  • openpyxl
  • Unidecode
  • Tesseract OCR
  • Pillow
  • pdf2image
  • requests
  • Docker
  • Docker Compose
  • Beetween
  • Quest
  • NoCRM
  • SQL
  • OneDrive
  • Microsoft Power BI