PDF-dən onlayn mətn çıxarın: PDF-i TXT-yə çevirmə, CMap qlif deşifrəsi və brauzerdə PDF.js
⚡3 sadə addımda PDF-dən mətn necə çıxarılır
1. Hədəf PDF-inizi idxal edin
PDF-inizi seçin və ya təhlükəsiz iş sahəsinə sürükləyin. Fayl sıfır server yükləməsi ilə brauzer RAM-ında yerli təhlil olunur.
2. Çıxış formatını və seçimləri seçin
Oxuna bilən mətn üçün 'Düz mətn (.txt)' və ya koordinat sərhəd qutularını və şrift metaməlumatını saxlamaq üçün 'Strukturlaşdırılmış JSON' seçin.
3. Dərhal çıxarın və endirin
Brauzer tərəfli məkan təhlilini icra etmək üçün 'Mətni çıxar' düyməsinə klikləyin. Çıxarılmış mətni birbaşa mübadilə buferinə kopyalayın və ya mətn faylını endirin.
Müasir məlumat mühəndisliyində, təbii dil emalında (NLP), hüquqi e-kəşfiyyatda və akademik tədqiqatda PDF sənədlərindən təmiz, korlanmamış düz mətn çıxarmaq məlumat qəbulunun təməl ilk addımıdır. Təşkilatlar Portable Document Format daxilində kilidlənmiş minlərlə rəqəmsal müqavilə, maliyyə balans hesabatı, tənzimləyici ağ kağız və tədqiqat işi alır. Lakin PDF mətn redaktoru sənədi deyil; o, mətni sadə fasiləsiz cümlələr və ya abzaslar kimi saxlamır. Əksinə, PDF ayrı-ayrı tipoqrafik qlifləri iki ölçülü kətan üzərində ixtiyari riyazi koordinatlarda yerləşdirən mürəkkəb vizual təlimat dəstidir.
Brauzer əsaslı «PDF-dən düz mətn çıxar» alətimiz korporativ səviyyəli mətn çıxarmanı birbaşa veb brauzerinizdə təqdim edir. Mozilla-nın sənaye standartı olan PDF.js render mühərriki və təcrid olunmuş Web Worker-lər əsasında işləyən sistemimiz sənəd məzmun axınlarını təhlil edir, mürəkkəb Character Map (CMap) kodlaşdırma cədvəllərini həll edir, tipoqrafik liqaturaları açır və təbii insan oxu sırasını bərpa edir. Saniyələr ərzində təmiz, formatlanmış UTF-8 düz mətn (.txt) və ya subpiksel sərhəd qutusu koordinatları olan strukturlaşdırılmış JSON maket cədvəlləri ixrac edin. Ən əsası, bütün hesablamalar 100% brauzer yaddaşınızda yerli icra olunur: məxfi maliyyə auditləriniz, xəstə kartlarınız və xüsusi tədqiqatlarınız heç vaxt xarici serverlərə toxunmur.
Tam texniki bələdçini oxu
Düz mətn illüziyası: PDF-lər tipoqrafiyanı əslində necə saxlayır
Bir çox kompüter istifadəçisi səhvən PDF-in mətni Microsoft Word və ya HTML kimi abzaslar, cümlələr və sözlər şəklində saxladığını düşünür. Reallıqda ISO 32000 spesifikasiyasına görə PDF PostScript-dən törəmiş vizual maket dilidir. Mətn `/Contents` axınları daxilində aşağı səviyyəli çəkmə operatorları ilə göstərilir.
Müəlliflik proqramı başlığı belə çıxış verərək göstərə bilər: `BT /F1 12 Tf 72 712 Td [(C) 12 (o) -4 (r) 8 (p)] TJ ET`. Diqqət edin ki, hərflər fərdi kerninq düzəlişləri ilə yerləşdirilir; sözlərdə hətta boşluq simvolları (`0x20`) olmaya bilər, əvəzində böyük mənfi üfüqi sürüşmələr olur. Bundan əlavə, mətn elementləri fayl binarında xronoloji sıradan kənar saxlanıla bilər — altbilgi sətri əsas başlıqdan əvvəl təhlil oluna bilər. Həqiqi mətn çıxarma dağınıq qlif koordinatlarını ardıcıl, oxuna bilən abzaslara yığmaq üçün mürəkkəb məkan bərpası evristikaları tələb edir.
Simvol xəritələri (CMap) və /ToUnicode tərcümə cədvəli
PDF mətn çıxarmasında ən çox rast gəlinən və çaşdırıcı problemlərdən biri sənəddən mətni kopyalayıb onu qəribə anlaşılmaz simvollar, sual işarələri və ya çap olunmayan qutular kimi yapışdırmaqdır. Bu fəlakətli xəta PDF düzgün `/ToUnicode` xəritə cədvəli olmadan xüsusi şrift alt dəsti kodlaşdırmalarından istifadə etdikdə baş verir.
Optimallaşdırılmış PDF-lərdə şriftlər alt dəstələrə bölünür: məzmun axınındakı simvol kodları (məsələn, `0x01`, `0x02` baytı) standart ASCII və ya Unicode-a uyğun gəlmir. Əksinə, onlar şrift proqramı daxilində ixtiyari qlif indekslərini təmsil edir. Uyğun PDF çıxarıcıları şriftin `/ToUnicode` CMap axınına — simvol kodlarını standartlaşdırılmış UTF-16 Unicode dəyərlərinə uyğunlaşdıran tərcümə lüğətinə — əsaslanır. Brauzer tərəfli mühərrikimiz yerləşdirilmiş CMap cədvəllərini, Adobe standart kodlaşdırmalarını (WinAnsi, MacRoman) və kompozit Type 0 CIDFont cədvəllərini dərindən təhlil edərək beynəlxalq əlifbalar üzrə dəqiq Unicode çevrilməsinə zəmanət verir.
Tipoqrafik liqaturalar, defislə keçirmə və söz sərhədlərinin aşkarlanması
Peşəkar nəşriyyat tipoqrafiyası liqaturalardan — seriflər arasında yöndəmsiz toqquşmaların qarşısını almaq üçün qonşu simvolların tək vizual dizaynda birləşdiyi kombinə edilmiş qliflərdən ('fi', 'fl', 'ffi', 'ffl' və 'st' kimi) — istifadə edir. Optimallaşdırılmamış çıxarıcılarda 'financial' sözünü kopyalamaq 'nancial' və ya 'fi nancial' ilə nəticələnir, çünki liqatura qlifinin 1-ə-1 ASCII uyğunluğu yoxdur.
Mühərrikimiz avtomatlaşdırılmış liqatura parçalanması təqdim edir. O, kompozit Unicode simvollarını ('fi' üçün `U+FB01` və 'fl' üçün `U+FB02` kimi) müəyyən edir və onları fərdi tərkib simvollarına ('f' + 'i') açır. Bundan əlavə, mühərrik sözlərarası məkan məsafələrini şrift irəliləmə eni metrikalarına (`wx`) qarşı qiymətləndirir, həqiqi boşluq simvollarını yalnız real söz fasilələri olan yerlərə daxil edir, sətir keçidlərindəki yumşaq ixtiyari defisləri isə silir.
Oxu sırasının bərpası: XY-Cut məkan maket alqoritmləri
Mürəkkəb çoxsütunlu sənədlərdən — akademik jurnal məqalələri, qəzet maketləri və ya korporativ balans hesabatları kimi — mətn çıxarmaq ciddi maket çətinlikləri yaradır. Proqram mətni səhifə boyunca sadəlövhcəsinə soldan sağa oxuyarsa, sütun sərhədlərini keçərək oxuyur, 1-ci sütunun cümlələrini birbaşa 2-ci sütunun cümlələri ilə birləşdirib anlaşılmaz cəfəngiyat yaradır.
Mühərrikimiz rekursiv XY-Cut məkan klasterləşdirmə alqoritmlərindən istifadə edir. O, hər mətn blokunun iki ölçülü sərhəd qutusu koordinatlarını təhlil edir, sütunlar arasındakı şaquli boşluq aralıqlarını müəyyən edir və səhifəni müstəqil oxu axını zonalarına bölür. 2-ci sütuna başlamazdan əvvəl 1-ci sütunu yuxarıdan aşağıya keçir və sonrakı təbii dil emalı (NLP) və LLM xülasələşdirməsi üçün təbii semantik davamlılığı qoruyur.
Sıfır bilikli yerli emal: məlumat axınları üçün mütləq məxfilik
Avtomatlaşdırılmış mətn çıxarması ən çox tələb olunan sənədlər həssas korporativ qeydlərdir: rüblük maliyyə hesabatları, idarə heyəti protokolları, məxfilik müqavilələri, məhkəmə çağırışları və məxfi işçi qeydləri. Bu xüsusi sənədləri ictimai bulud əsaslı çevirmə API-lərinə yükləmək korporativ məlumat rezidentliyi siyasətlərini pozur və təşkilatları ciddi sızma məsuliyyətlərinə məruz qoyur.
«PDF-dən düz mətn çıxar» alətimiz güzəştsiz brauzer tərəfli məlumat suverenliyi ilə işləyir. Saf WebAssembly və təcrid olunmuş Web Worker-lər əsasında bütün PDF təhlili, CMap həlli və mətn axını yaradılması ciddi şəkildə yerli brauzer tabınızda icra olunur. Fayllarınız heç vaxt xarici bulud serverlərinə toxunmur və ictimai şəbəkələri keçmir.
Düz mətn (.txt) və strukturlaşdırılmış JSON maket çıxarması
Müxtəlif məlumat mühəndisliyi iş axınları fərqli məlumat formatları tələb edir. İnsan oxucular və sadə mətn axtarış indeksləyiciləri təbii abzas sətir keçidləri olan təmiz, formatlanmış düz mətn (`.txt`) faylını üstün tutsa da, maşın öyrənmə axınları struktur metaməlumatı tələb edir.
Alətimiz hər iki ixrac rejimini dəstəkləyir: dərhal oxumaq üçün təmiz UTF-8 düz mətn endirin və ya dəqiq səhifə nömrələrini, sətir sərhəd qutularını `[x, y, width, height]`, şrift ailəsi adlarını, şrift ölçüsü metrikalarını və oxu sırası indekslərini ehtiva edən maşın tərəfindən oxuna bilən JSON iyerarxiyası ixrac edərək korporativ ETL axınlarına proqram inteqrasiyasını təmin edin.
💡Qüsursuz PDF mətn çıxarması üçün peşəkar tövsiyələr
- •PDF-inizdən mətn kopyalamaq əvvəllər qəribə cəfəngiyat və ya simvollarla nəticələnibsə, alətimizin CMap /ToUnicode həlledicisi kodlaşdırmanı avtomatik düzəldəcək.
- •Çoxsütunlu akademik məqalələr üçün XY-Cut alqoritmimiz mətnin cümlələri üfüqi qarışdırmaq əvəzinə sütun-sütun oxunmasını təmin edir.
- •Python, Pandas və ya süni intellekt təlim dəstləri üçün məlumat çıxarma axınları qurursunuzsa, strukturlaşdırılmış JSON rejimində ixrac edin.
- •Nəzərə alın ki, bu alət rəqəmsal vektor mətni çıxarır. PDF-iniz skan edilmiş fiziki kağızdan (bitmap şəkillər) ibarətdirsə, əvvəlcə optik simvol tanıma (OCR) tətbiq etməlisiniz.
- •Əsas rəqəmlərin və terminlərin dəqiq tutulduğunu tez yoxlamaq üçün çıxarılmış mətn önizləməsində brauzerinizin axtarış qısayolundan (Ctrl+F / Cmd+F) istifadə edin.
🛡️Web Worker mətn qatı təhlili və CMap Unicode həlli
Mətn çıxarma axınımız Mozilla-nın PDF.js kitabxanasından istifadə edən sandbox Web Worker daxilində icra olunur. Worker PDF çarpaz istinad cədvəlini deşifrə edir, `/Pages` ağacını əldə edir və səhifə `/Contents` axınlarını yükləyir. O, dəqiq kətan koordinatlarını müəyyən etmək üçün Cari Transformasiya Matrisini (CTM) və Mətn Matrisini (`Tm`) izləyərək mətn operatorlarını (`BT`, `Tj`, `TJ`, `ET`) tokenləşdirir. Aktiv şrift lüğətinin `/ToUnicode` axınını qiymətləndirir, simvol kodlarını CMap BFH (BeginFontHeader) və BFRange xəritə cədvəlləri vasitəsilə standartlaşdırılmış UTF-16 kod vahidlərinə tərcümə edir. Liqaturalar parçalanır, sətir keçidi həddləri şrift irəliləmə enlərinə qarşı qiymətləndirilir və strukturlaşdırılmış mətn axınları tamamilə uçucu brauzer yaddaşında təmiz UTF-8 sətirlərinə seriyalaşdırılır.
Texnologiya: WebAssembly • Çoxaxınlı Web Workers • HTML5 Canvas API
Məxfilik: Fayllar cihazınızı tərk etmir və buludda saxlanmır; analitika yalnız razılığınızla işləyir.
Bu iş axını üçün tamamlayıcı alətlər
Yüksək performanslı iş axınları üçün bu brauzer alətlərini birlikdə istifadə edin.
PDF-dən JPG şəkillərə
PDF-in hər səhifəsindən yüksək dəqiqlikli JPG şəkillər çıxarın.
PDF-dən PNG şəkillərə
PDF səhifələrini kristal kimi aydın, itkisiz PNG şəkillərinə çevirin.
PDF-dən WebP şəkillərə
PDF səhifələrini veb səhifələr üçün optimallaşdırılmış yüngül WebP fayllarına ixrac edin.
JPG-dən PDF sənədinə
Fotoları, qəbzləri və skanları çoxsəhifəli PDF sənədinə çevirin.