Procesi i shndërrimit të HTML-së së strukturuar në tekst të thjeshtë
Shndërrimi i dokumenteve të strukturuara HTML në tekst të thjeshtë dhe të pastër kërkon një proces të saktë të eliminimit të elementeve të kodit pa humbur kuptueshmërinë e përmbajtjes. HTML-ja përdor etiketa për të përcaktuar strukturën, stilin dhe sjelljen e një faqeje interneti. Gjatë nxjerrjes së tekstit, thjesht heqja e kllapave këndore < dhe > nuk mjafton, pasi kjo do të linte pas mbetje të kodeve programuese ose stilit.
Kjo vegël analizon kodin e dhënë dhe eliminon plotësisht etiketat HTML, duke përfshirë blloket e brendshme të skripteve (script), stileve (style), shablloneve (template) dhe blloket noscript. Rezultati i këtij procesi është një tekst i pastër, i cili ruan vetëm përmbajtjen e lexueshme për njerëzit. Ky proces është i domosdoshëm për skenarë të ndryshëm si:
- Konvertimi i tekstit të pasur (rich text) në tekst të thjeshtë që mund të kopjohet lehtësisht.
- Nxjerrja e tekstit të pastër nga fragmente të veçanta të faqeve të internetit.
- Përfitimi i tekstit pa kode nga të dhënat e mbledhura (scraped HTML) nga interneti.
- Redaktimi i teksteve që fillimisht kanë qenë të formatuara në gjuhën HTML.
Rregullat e përpunimit dhe trajtimi i rasteve specifike
Gjatë procesit të pastrimit, veglat zbatojnë rregulla të rrepta për të siguruar që teksti përfundimtar të jetë i lexueshëm dhe i strukturuar siç duhet. Këto rregulla përcaktojnë se si trajtohen elementet e ndryshme të kodit burimor:
| Elementi HTML | Rregulli i Trajtimit |
|---|---|
Blloket script, style, template, noscript |
Hiqen plotësisht së bashku me përmbajtjen e tyre. |
Elementet e bllokut dhe etiketat <br> |
Kthehen në thyerje rreshti në tekstin përfundimtar. |
| Entitetet HTML | Dekodohen në karakteret përkatëse. |
| Hapësirat e përsëritura | Pastrohen dhe rregullohen për një pamje të njëtrajtshme. |
Nëse fusha e hyrjes është bosh, sistemi shfaq mesazhin "Shtoni HTML për të nxjerrë tekstin e thjeshtë.". Vegla pranon një gjatësi maksimale prej 500,000 karakteresh për kodin HTML të futur. Nëse ky limit tejkalohet, përdoruesit i shfaqet mesazhi i gabimit "Ky HTML është shumë i gjatë për këtë vegël. Mbajeni nën {max} karaktere.". Në rastet kur struktura e kodit është e dëmtuar rëndë dhe procesi dështon, shfaqet njoftimi "Nuk u mundësua nxjerrja e tekstit nga ky HTML.". Funksionet "Kopjoni tekstin e thjeshtë" dhe "Përdor rezultatin" çaktivizohen automatikisht kur fusha e rezultatit është bosh.
Roli i elementeve të bllokut dhe thyerjeve të rreshtit
Në HTML, elementet ndahen në elemente blloku (si <div>, <p>, <h1> etj.) dhe elemente të brendshme (inline) si <span> ose <strong>. Elementet e bllokut krijojnë natyrshëm një ndarje vizuale në faqe duke filluar në një rresht të ri.
Gjatë konvertimit në tekst të thjeshtë, ruajtja e këtyre ndarjeve është kritike për të mos përfunduar me një bllok të vetëm dhe të palexueshëm teksti. Vegla i kthen këto elemente blloku, së bashku me etiketat e thyerjes së rreshtit <br>, në thyerje reale rreshti (line breaks). Gjithashtu, hapësirat e përsëritura zëvendësohen me një hapësirë të vetme për të shmangur zbrazëtitë e panevojshme në tekstin e përfituar.
Kuptimi dhe dekodimi i entiteteve HTML
Entitetet HTML janë sekuenca karakteresh që fillojnë me simbolin & dhe mbarojnë me ;. Ato përdoren në kodimin e faqeve të internetit për të shfaqur karaktere të rezervuara (si < dhe > që mund të ngatërrohen me etiketat) ose karaktere që nuk gjenden lehtësisht në tastierë (si p.sh. simbolet e autorësisë ose hapësirat e pandashme).
Gjatë kalimit në tekst të thjeshtë, këto entitete duhet të kthehen në karakteret e tyre reale që të jenë të lexueshme për përdoruesin. Për shembull, entiteti & konvertohet në &, < bëhet <, dhe " kthehet në thonjëza të dyfishta. Vegla kryen këtë dekodim automatikisht për të gjitha entitetet e zakonshme.
Privatësia e të dhënave dhe përpunimi në shfletues
Siguria e të dhënave është një faktor i rëndësishëm gjatë punës me tekste që mund të përmbajnë informacione personale ose profesionale. Ky proces pastrimi kryhet tërësisht brenda shfletuesit tuaj të internetit.
Kodi HTML që vendosni në fushën e hyrjes nuk dërgohet në serverët tanë dhe asgjë nuk ngarkohet në BroBroGo. Përpunimi lokal në pajisjen tuaj siguron që të dhënat të mbeten private dhe të mos ekspozohen gjatë transmetimit në rrjet.
Pyetje të shpeshta (FAQ)
Çfarë ndodh me përmbajtjen e skripteve dhe stileve?
Blloket e skripteve (script), stileve (style), shablloneve (template) dhe noscript lihen jashtë rezultatit, në mënyrë që rezultati të fokusohet në tekstin e lexueshëm të faqes.
A i dekodon entitetet HTML?
Po. Entitetet e zakonshme kthehen në karakteret që ato përfaqësojnë në tekstin e thjeshtë të përfituar.
A ruhen paragrafët dhe thyerjet e rreshtave?
Elementet e bllokut dhe thyerjet e rreshtit kthehen në thyerje rreshti. Hapësirat e përsëritura pastrohen në mënyrë që rezultati të jetë i lehtë për t'u kopjuar.
Çfarë ndodh nëse teksti i futur nuk ka etiketa HTML?
Nëse në fushën e hyrjes nuk detektohet asnjë etiketë HTML, sistemi do të shfaqë mesazhin "Nuk u gjet asnjë etiketë HTML. Teksti u mbajt si tekst i thjeshtë." dhe teksti juaj do të mbetet i pandryshuar.