ConfidensIA

Travaux

Travaux et publications

Nous publions nos modèles, articles et code, y compris les versions préliminaires et les chantiers en cours. Une démarche de R&D se juge aussi sur l'honnêteté de ses limites.

Zenodo · DOI 10.5281/zenodo.20680140 · 2026

LaPlume : un pipeline hybride de pseudonymisation des récits sociaux et médico-sociaux français

Article complet présentant la conception, l'architecture et l'évaluation empirique du pipeline LaPlume. Évaluation humaine sur 10 rapports ESSMS complexes (double aveugle, 313 désaccords arbitrés) : F1 pondéré par criticité 96,7 % (CRIT : 98,4 %). Étude comparative avec OpenAI Privacy Filter documentant une latence 3 à 11 fois plus faible en CPU.

Zenodo · DOI 10.5281/zenodo.20680586 · 2026 · avec Yoann Van Messen

Mémoire organisationnelle, récits professionnels et risque de ré-attribution narrative dans les ESSMS

Introduction du concept de ré-attribution narrative et du modèle formel R(d, ℓ) à quatre composantes. Estimé par protocole proxy LLM à trois profils de lecteurs sur 668 rapports sociaux — AUC = 0,712, saillance narrative comme prédicteur dominant (OR = 2,12). Première opérationnalisation computationnelle du critère « moyens raisonnables » du considérant 26 RGPD sur des textes narratifs.

Working paper · 2026 · préliminaire

Pseudonymisation et risque de réidentification

Premiers résultats d'évaluation de LaPlume et modèle de risque R(d,l) à quatre composantes, avec protocole d'annotation à trois profils de lecteurs.

Zenodo · DOI 10.5281/zenodo.17689395

ConfidensIA : Système de pseudonymisation fine-grained pour le secteur médico-social français

Le papier Zenodo documente le système complet. Le dépôt modèle Hugging Face porte sur le moteur NER optimisé du pipeline (distillation 9 couches) ; l'originalité méthodologique repose aussi sur la constitution du corpus sectoriel.

Article · 2026 · LinkedIn Pulse

Le prochain sujet stratégique des ESMS ne sera pas l'IA

Comment l'IA fera de la mémoire organisationnelle une priorité. Article à deux voix avec Yoann Van Messen analysant pourquoi le véritable enjeu des organisations médico-sociales réside dans leur capacité à transformer une documentation fragmentée en intelligence opérationnelle collective, plutôt que de chercher une IA magique.

Code open source (GitHub)

ConfidensIA Lab publie les briques techniques développées dans le cadre de ses programmes de R&D. Trois dépôts sont actuellement disponibles en open source.

Nouveaux dépôtsContributions publiquesApache-2.0
  • Générateur de corpus NLP pour la reconnaissance d'entités nommées (NER) ESSMS.
  • Pipeline de distillation CamemBERT-NER (8 tentatives documentées et bugs critiques résolus).
  • Pipeline de veille réglementaire avec scraper API Legifrance (PISTE / DILA) et filtre sectoriel.
Voir l'organisation GitHub

Dépôts publics

Isolés des briques privées de production, publiés comme base de contribution.

confidensia-lab sur GitHub
NouveauPython

NLP · Dataset engineering

corpus-generator

Génération, validation et export public d'un corpus synthétique pour le NER francophone dans le secteur social et médico-social.

Ouvrir le dépôt
NouveauDistillation

Model distillation · CamemBERT NER

distillation-laplume

Distillation 11L vers 9L de CamemBERT-NER, avec journal des 8 tentatives, analyse des échecs et correctifs des bugs de pipeline les plus critiques.

Ouvrir le dépôt
NouveauVeille réglementaire

Regulatory intelligence · Legifrance API

veille-essms

Pipeline automatisé de veille réglementaire ESSMS, avec collecte via API PISTE / DILA et filtrage de pertinence orienté métier.

Ouvrir le dépôt