Le défi : donner du sens à des documents hétérogènes
Les professionnels de santé reçoivent chaque jour des documents très différents : PDF textuels, courriers scannés, comptes rendus produits par des établissements externes ou documents dont la structure varie selon l'émetteur.
Leur traitement nécessite habituellement plusieurs opérations manuelles : lire le document, identifier le patient, retrouver son dossier, reconnaître l'auteur et la nature du courrier, puis saisir les métadonnées nécessaires à son classement. Certaines pièces doivent en outre déclencher une action, par exemple recontacter un patient à la suite d'une demande d'adressage ou de prise en charge.
Meiflow avait besoin d'une chaîne capable de préparer automatiquement ce travail sans enregistrer comme certaines des informations issues d'une extraction probabiliste.
Mission
Akimed a développé une chaîne hybride qui transforme un document non structuré en une proposition de classement et d'action.
Les informations recherchées couvrent notamment :
- le nom, le prénom, la date de naissance et le numéro INS du patient ;
- le nom, le prénom, la spécialité et le numéro RPPS du professionnel émetteur ;
- le type et la date du compte rendu ;
- un indicateur signalant que le document nécessite une action.
La validation humaine est conservée avant l'utilisation définitive des informations proposées.
Une extraction hybride, adaptée à chaque document
La chaîne commence par extraire localement le texte du fichier. Lorsque le document contient trop peu de mots exploitables, elle déclenche automatiquement un traitement de reconnaissance optique de caractères (OCR) de repli.
Cette stratégie évite d'appliquer systématiquement un traitement plus coûteux aux PDF qui contiennent déjà du texte. Le contenu obtenu est ensuite transmis au service d'analyse, qui en extrait les données structurées utiles au classement.
La séparation entre les services d'extraction, d'OCR et d'analyse permet de faire évoluer ou de remplacer chaque implémentation derrière une interface stable.
L'OCR n'est déclenché que si l'extraction locale ne fournit pas suffisamment de texte exploitable.
L'innovation : qualifier les données dans l'écosystème de santé
Extraire un nom ou un numéro ne suffit pas à rattacher un document avec un niveau de confiance satisfaisant. L'innovation réside donc aussi dans la qualification des informations au regard des référentiels du système de santé.
Les identités patient extraites peuvent être rapprochées et vérifiées à l'aide de l'Identité Nationale de Santé (INS). Les professionnels, leurs spécialités et leurs identifiants peuvent être confrontés aux informations de l'Annuaire Santé à partir du numéro RPPS.
Ces vérifications renforcent la fiabilité des propositions et limitent le risque qu'une donnée produite par un modèle probabiliste soit enregistrée directement comme une information certaine.
Une architecture souveraine pour les données sensibles
La chaîne a été pensée pour fonctionner dans un environnement souverain compatible avec l'hébergement de données de santé. Son architecture :
- limite les transferts de données ;
- réalise localement la première extraction de texte ;
- déclenche l'OCR uniquement lorsque le contenu l'exige ;
- isole les services d'extraction et d'analyse ;
- permet de remplacer les modèles utilisés sans reconstruire tout le parcours.
Ce découpage répond à la fois aux exigences associées aux données sensibles et au besoin de faire évoluer les technologies d'analyse.
Impact
Un document entrant peut désormais être transformé en une proposition structurée comprenant :
- le patient auquel il semble se rapporter ;
- l'identité et la spécialité de son auteur ;
- sa typologie et sa date ;
- la spécialité médicale concernée ;
- l'éventuelle nécessité de recontacter le patient ou d'engager une action.
Le professionnel ne part plus d'un document brut : il contrôle une proposition déjà qualifiée, puis la valide avant son intégration au dossier.
Le « plus » Akimed
Nous avons associé extraction documentaire, OCR ciblé, analyse structurée et vérification par les référentiels de santé dans une architecture modulaire et souveraine. Cette approche automatise le travail répétitif tout en maintenant une validation humaine là où la fiabilité clinique et l'identitovigilance l'exigent.




