Skip to content

Ajouter fonction Power BI M pour nettoyer/parser les noms et listes de prénoms QC/Canada - #2

Open
charles-hebert wants to merge 1 commit into
mainfrom
codex/create-powerbi-function-for-name-cleaning
Open

Ajouter fonction Power BI M pour nettoyer/parser les noms et listes de prénoms QC/Canada#2
charles-hebert wants to merge 1 commit into
mainfrom
codex/create-powerbi-function-for-name-cleaning

Conversation

@charles-hebert

Copy link
Copy Markdown
Owner

Motivation

  • Fournir une fonction Power Query autonome capable de nettoyer et d’extraire des composants d’un champ « nom » francophone (salutation, nom de famille, initiale, prénom, titre, nom usuel) tout en préservant les accents et en supportant prénoms composés.
  • Gérer les cas courants de bruit texte (espaces multiples, apostrophes variées), les préfixes/suffixes fréquents, l’inversion prénom/nom et proposer un fallback fuzzy matching contre des dictionnaires locaux.

Description

  • Ajout de powerbi/fxNettoyerParserNom.m exposant la fonction fxNettoyerParserNom(NomComplet, optional PrenomsDictionnaire, optional NomsDictionnaire) qui renvoie un record avec les champs TexteNettoye, Salutation, NomFamille, Initiale, Prenom, Titre, NomUsuel, InversionCorrigee, MethodeCorrespondancePrenom, MethodeCorrespondanceNom, PrefixesTable et SuffixesTable.
  • Implémentation des étapes de nettoyage (trim, suppression d’espaces multiples), normalisation des apostrophes sans enlever les accents, capitalisation correcte (gestion des apostrophes et des prénoms hyphenés), extraction du nom usuel entre parenthèses / guillemets et détection d’initiales.
  • Tables intégrées pour salutations et suffixes, heuristique de correction d’inversion prénom/nom, recherche par correspondance exacte contre dictionnaires fournis, puis fallback fuzzy (Table.FuzzyNestedJoin) en dernier recours.
  • Ajout de deux listes importables pour Power BI dans powerbi/lists/prenoms_quebec.csv et powerbi/lists/prenoms_canada.csv destinées à servir de dictionnaires pour le matching.

Testing

  • Vérification automatisée de la présence des fichiers générés (powerbi/fxNettoyerParserNom.m, powerbi/lists/prenoms_quebec.csv, powerbi/lists/prenoms_canada.csv) réussie.
  • Test automatisé d’intégrité et d’unicité des CSV via un script Python qui a confirmé prenoms_quebec.csv = 113 entrées uniques et prenoms_canada.csv = 120 entrées uniques.

Codex Task

@chatgpt-codex-connector chatgpt-codex-connector Bot left a comment

Copy link
Copy Markdown

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

💡 Codex Review

Here are some automated review suggestions for this pull request.

Reviewed commit: 591e8e5a4f

ℹ️ About Codex in GitHub

Your team has set up Codex to review pull requests in this repo. Reviews are triggered when you

  • Open a pull request for review
  • Mark a draft as ready
  • Comment "@codex review".

If Codex has suggestions, it will comment; otherwise it will react with 👍.

Codex can also answer questions or update the PR. Try commenting "@codex address that feedback".

Comment on lines +91 to +92
q1 = Text.BetweenDelimiters(Cleaned, "\"", "\"", 0, 0),
q2 = Text.BetweenDelimiters(Cleaned, "'", "'", 0, 0)

Copy link
Copy Markdown

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

P1 Badge Guard nickname extraction when quotes are absent

Text.BetweenDelimiters is called directly on Cleaned for both double and single quotes, but this function throws when the delimiters are missing; for typical inputs like "Marie Tremblay" (no quoted nickname), parsing fails immediately instead of returning a record. Wrapping these calls with try ... otherwise null (or checking delimiter presence first) is needed to keep non-quoted names supported.

Useful? React with 👍 / 👎.

NicknameParen = Text.BetweenDelimiters(Cleaned, "(", ")", 0, 0),
NomUsuel = if NicknameParen <> null and Text.Trim(NicknameParen) <> "" then Text.Trim(NicknameParen) else if NicknameQuoted <> null and Text.Trim(NicknameQuoted) <> "" then Text.Trim(NicknameQuoted) else null,

WithoutParen = Text.BeforeDelimiter(Cleaned, "(", 0),

Copy link
Copy Markdown

Choose a reason for hiding this comment

The reason will be displayed to describe this comment to others. Learn more.

P1 Badge Handle missing parenthesis before calling BeforeDelimiter

Text.BeforeDelimiter(Cleaned, "(", 0) is unguarded and will error when the input has no parenthetical nickname, which is a common case; even if quote parsing is fixed, ordinary names without ( still crash at this step. This should be protected with try ... otherwise Cleaned (or a delimiter existence check) so parsing continues.

Useful? React with 👍 / 👎.

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant