Briques réutilisables :
- dates_fr : lit les formes réelles du corpus (« 23 avr. 2026 (JO 24 avr.) »,
« 1er juill. », « 24.07.2026 ») et distingue une date exacte d'une échéance
prévisionnelle (« Fin août 2026 » → situé au 25, libellé conservé, jamais
présenté comme un fait)
- markdown : découpage des tableaux (barres échappées, lignes courtes),
nettoyage, extraction des marqueurs [^dim07-24^] / [^phase5-3.1^]
Parseur sec10 :
- 27 lois promulguées + 21 lignes simples + 2 lignes éclatées en 4 textes = 52
- éclatement justifié : les lignes « accords Kazakhstan et Colombie » et
« MACF » décrivent chacune deux textes de statuts différents
- migration 002 : regime_libertes stocké à part, faute de savoir quel public
la cotation globale du rapport vise — dérouler « droits+ » sur les trois
publics aurait inventé une ventilation absente de la source
- migration 003 : la facette « devant le CC » couvre aussi les saisines sans
numéro d'affaire (programmation militaire), sinon 6 textes au lieu de 7
Trois pièges du corpus, corrigés et couverts par des tests :
- « eau » matchait comme sous-chaîne dans réseaux / drapeau / Retailleau
- une décision citée sans saisine créait une fausse saisine (loi Philippine)
- la date de saisine était pêchée dans la colonne « échéance », datant la
saisine de l'aide à mourir du mois suivant
72 tests, 90 % de couverture sur pipeline/.
Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>