Fonctionnement de la déduplication de texte
L'outil de déduplication de texte traite une liste d'éléments saisis ligne par ligne pour en éliminer les répétitions. Le processus analyse chaque ligne de l'entrée et supprime les lignes qui sont des doublons exacts, en ne conservant que la première occurrence de chaque élément.
Après le traitement, l'outil affiche la liste nettoyée et fournit des statistiques précises sur la composition du texte: le nombre de lignes initiales, le nombre de lignes uniques conservées et le nombre de doublons supprimés.
Critères de correspondance exacte et traitement des données
Pour qu'une ligne soit considérée comme un doublon, elle doit correspondre exactement à une ligne précédente. Cette comparaison stricte implique plusieurs règles:
- Sensibilité à la casse: Les majuscules et les minuscules sont différenciées. Par exemple, « pomme » et « Pomme » sont considérées comme deux lignes distinctes.
- Espaces: Les espaces en début, en milieu ou en fin de ligne sont pris en compte. Deux lignes contenant les mêmes mots mais avec des espaces différents ne sont pas identifiées comme des doublons.
- Lignes vides: Les lignes vides sont traitées de la même manière que les lignes de texte. Si l'entrée contient plusieurs lignes vides, seule la première est conservée, et les suivantes sont supprimées.
Le processus préserve l'ordre d'origine des éléments. Lorsqu'un doublon est détecté, sa première apparition dans la liste est maintenue à sa position initiale, tandis que toutes les répétitions suivantes sont éliminées. Cela permet de nettoyer des listes ordonnées ou chronologiques sans en perturber la structure globale.
Limites techniques et gestion des erreurs
L'outil est conçu pour traiter des volumes de texte allant jusqu'à une limite stricte de 500 000 caractères. Si le texte saisi dépasse cette taille maximale, le traitement s'interrompt et le message d'erreur suivant s'affiche: « Ce texte est trop long pour cet outil. Gardez-le sous {max} caractères. ». Dans ce cas, les compteurs de lignes restent à 0.
En cas d'anomalie imprévue lors de l'analyse du texte, l'interface affiche le message: « Impossible de dédupliquer ce texte. ».
Lorsque l'utilisateur vide le champ de saisie à l'aide de la fonction dédiée, l'interface affiche « Effacé. ». Les champs d'entrée et de sortie deviennent vides, et les compteurs pour les statistiques « Original », « Uniques » et « Retirées » sont réinitialisés à 0. De plus, les fonctions pour copier le texte ou pour « Utiliser le résultat » sont désactivées tant que l'entrée reste vide.
Confidentialité et traitement local
Le traitement des données s'effectue exclusivement au sein du navigateur web de l'utilisateur. Aucun texte saisi ou traité n'est envoyé vers les serveurs de BroBroGo. Cette exécution locale garantit que les données ne transitent pas sur le réseau et restent confinées à l'environnement de travail de l'utilisateur.
Guide de l'interface et indicateurs de statut
L'interface utilisateur affiche des messages de statut spécifiques selon l'état du traitement:
- Entrée vide: Si aucun texte n'est présent, le message « Ajoutez des lignes pour retirer les doublons. » s'affiche.
- Aucun doublon détecté: Si toutes les lignes saisies sont uniques, l'outil indique: « Aucune ligne en double trouvée.
{unique}lignes conservées. ». - Doublons supprimés: Lorsque des lignes répétées sont éliminées, le statut affiche: «
{removed}lignes en double retirées;{unique}sur{total}conservées. ». - Chargement de l'exemple: L'utilisation du texte d'exemple affiche le message « Exemple nettoyé. ».
- Réinjection du résultat: Lorsque l'utilisateur clique sur le bouton pour réinjecter le résultat dans le champ de saisie, le message « Lignes nettoyées replacées en entrée. » apparaît.
Les statistiques de traitement sont réparties sous trois indicateurs:
- Original: Le nombre total de lignes soumises à l'entrée.
- Uniques: Le nombre de lignes uniques restantes après le nettoyage.
- Retirées: Le nombre de lignes en double qui ont été supprimées.
Exemple de déduplication
Prenons l'exemple de liste suivant fourni par l'outil:
pomme
banane
pomme
carotte
banane
tarte aux pommes
carotte
Après traitement par l'outil, les doublons de « pomme », « banane » et « carotte » sont identifiés et supprimés. Seule la première occurrence de chaque élément est conservée, ce qui produit le résultat suivant sous le label « Lignes uniques »:
pomme
banane
carotte
tarte aux pommes
L'ordre initial des premiers éléments uniques est respecté, et la ligne « tarte aux pommes » reste à sa place car elle ne correspond pas exactement à la ligne « pomme ».
Foire aux questions
Qu’est-ce qu’une ligne en double? Deux lignes doivent être identiques, espaces et majuscules compris. La première reste, les suivantes sont retirées.
L’ordre original est-il conservé? Oui. Le résultat suit la première apparition de chaque ligne, donc votre liste garde son ordre après suppression des doublons.
Que deviennent les lignes vides? Les lignes vides sont traitées comme les autres. Si plusieurs se répètent, seule la première ligne vide est conservée.
Où mes données sont-elles envoyées pour être traitées? Votre texte est dédupliqué dans votre navigateur. Rien n’est envoyé à BroBroGo.