PDF-dən düz mətn çıxar

PDF fayllarındakı bütün mətni kopyalana bilən düz mətnə çıxarın.

100% brauzerdə • 100% pulsuz
📄

PDF-i bura buraxın və ya fayllara baxın

Bütün daxili mətni brauzer yaddaşında yerli çıxarır

Ətraflı texniki bələdçi•8 dəq oxu•2RUN Mühəndislik Komandası
100% brauzerdə • Sıfır yükləmə

PDF-dən onlayn mətn çıxarın: PDF-i TXT-yə çevirmə, CMap qlif deşifrəsi və brauzerdə PDF.js

⚡3 sadə addımda PDF-dən mətn necə çıxarılır

1

1. Hədəf PDF-inizi idxal edin

PDF-inizi seçin və ya təhlükəsiz iş sahəsinə sürükləyin. Fayl sıfır server yükləməsi ilə brauzer RAM-ında yerli təhlil olunur.

2

2. Çıxış formatını və seçimləri seçin

Oxuna bilən mətn üçün 'Düz mətn (.txt)' və ya koordinat sərhəd qutularını və şrift metaməlumatını saxlamaq üçün 'Strukturlaşdırılmış JSON' seçin.

3

3. Dərhal çıxarın və endirin

Brauzer tərəfli məkan təhlilini icra etmək üçün 'Mətni çıxar' düyməsinə klikləyin. Çıxarılmış mətni birbaşa mübadilə buferinə kopyalayın və ya mətn faylını endirin.

Müasir məlumat mühəndisliyində, təbii dil emalında (NLP), hüquqi e-kəşfiyyatda və akademik tədqiqatda PDF sənədlərindən təmiz, korlanmamış düz mətn çıxarmaq məlumat qəbulunun təməl ilk addımıdır. Təşkilatlar Portable Document Format daxilində kilidlənmiş minlərlə rəqəmsal müqavilə, maliyyə balans hesabatı, tənzimləyici ağ kağız və tədqiqat işi alır. Lakin PDF mətn redaktoru sənədi deyil; o, mətni sadə fasiləsiz cümlələr və ya abzaslar kimi saxlamır. Əksinə, PDF ayrı-ayrı tipoqrafik qlifləri iki ölçülü kətan üzərində ixtiyari riyazi koordinatlarda yerləşdirən mürəkkəb vizual təlimat dəstidir.

Brauzer əsaslı «PDF-dən düz mətn çıxar» alətimiz korporativ səviyyəli mətn çıxarmanı birbaşa veb brauzerinizdə təqdim edir. Mozilla-nın sənaye standartı olan PDF.js render mühərriki və təcrid olunmuş Web Worker-lər əsasında işləyən sistemimiz sənəd məzmun axınlarını təhlil edir, mürəkkəb Character Map (CMap) kodlaşdırma cədvəllərini həll edir, tipoqrafik liqaturaları açır və təbii insan oxu sırasını bərpa edir. Saniyələr ərzində təmiz, formatlanmış UTF-8 düz mətn (.txt) və ya subpiksel sərhəd qutusu koordinatları olan strukturlaşdırılmış JSON maket cədvəlləri ixrac edin. Ən əsası, bütün hesablamalar 100% brauzer yaddaşınızda yerli icra olunur: məxfi maliyyə auditləriniz, xəstə kartlarınız və xüsusi tədqiqatlarınız heç vaxt xarici serverlərə toxunmur.

Tam texniki bələdçini oxu

Düz mətn illüziyası: PDF-lər tipoqrafiyanı əslində necə saxlayır

Bir çox kompüter istifadəçisi səhvən PDF-in mətni Microsoft Word və ya HTML kimi abzaslar, cümlələr və sözlər şəklində saxladığını düşünür. Reallıqda ISO 32000 spesifikasiyasına görə PDF PostScript-dən törəmiş vizual maket dilidir. Mətn `/Contents` axınları daxilində aşağı səviyyəli çəkmə operatorları ilə göstərilir.

Müəlliflik proqramı başlığı belə çıxış verərək göstərə bilər: `BT /F1 12 Tf 72 712 Td [(C) 12 (o) -4 (r) 8 (p)] TJ ET`. Diqqət edin ki, hərflər fərdi kerninq düzəlişləri ilə yerləşdirilir; sözlərdə hətta boşluq simvolları (`0x20`) olmaya bilər, əvəzində böyük mənfi üfüqi sürüşmələr olur. Bundan əlavə, mətn elementləri fayl binarında xronoloji sıradan kənar saxlanıla bilər — altbilgi sətri əsas başlıqdan əvvəl təhlil oluna bilər. Həqiqi mətn çıxarma dağınıq qlif koordinatlarını ardıcıl, oxuna bilən abzaslara yığmaq üçün mürəkkəb məkan bərpası evristikaları tələb edir.

Simvol xəritələri (CMap) və /ToUnicode tərcümə cədvəli

PDF mətn çıxarmasında ən çox rast gəlinən və çaşdırıcı problemlərdən biri sənəddən mətni kopyalayıb onu qəribə anlaşılmaz simvollar, sual işarələri və ya çap olunmayan qutular kimi yapışdırmaqdır. Bu fəlakətli xəta PDF düzgün `/ToUnicode` xəritə cədvəli olmadan xüsusi şrift alt dəsti kodlaşdırmalarından istifadə etdikdə baş verir.

Optimallaşdırılmış PDF-lərdə şriftlər alt dəstələrə bölünür: məzmun axınındakı simvol kodları (məsələn, `0x01`, `0x02` baytı) standart ASCII və ya Unicode-a uyğun gəlmir. Əksinə, onlar şrift proqramı daxilində ixtiyari qlif indekslərini təmsil edir. Uyğun PDF çıxarıcıları şriftin `/ToUnicode` CMap axınına — simvol kodlarını standartlaşdırılmış UTF-16 Unicode dəyərlərinə uyğunlaşdıran tərcümə lüğətinə — əsaslanır. Brauzer tərəfli mühərrikimiz yerləşdirilmiş CMap cədvəllərini, Adobe standart kodlaşdırmalarını (WinAnsi, MacRoman) və kompozit Type 0 CIDFont cədvəllərini dərindən təhlil edərək beynəlxalq əlifbalar üzrə dəqiq Unicode çevrilməsinə zəmanət verir.

Tipoqrafik liqaturalar, defislə keçirmə və söz sərhədlərinin aşkarlanması

Peşəkar nəşriyyat tipoqrafiyası liqaturalardan — seriflər arasında yöndəmsiz toqquşmaların qarşısını almaq üçün qonşu simvolların tək vizual dizaynda birləşdiyi kombinə edilmiş qliflərdən ('fi', 'fl', 'ffi', 'ffl' və 'st' kimi) — istifadə edir. Optimallaşdırılmamış çıxarıcılarda 'financial' sözünü kopyalamaq 'nancial' və ya 'fi nancial' ilə nəticələnir, çünki liqatura qlifinin 1-ə-1 ASCII uyğunluğu yoxdur.

Mühərrikimiz avtomatlaşdırılmış liqatura parçalanması təqdim edir. O, kompozit Unicode simvollarını ('fi' üçün `U+FB01` və 'fl' üçün `U+FB02` kimi) müəyyən edir və onları fərdi tərkib simvollarına ('f' + 'i') açır. Bundan əlavə, mühərrik sözlərarası məkan məsafələrini şrift irəliləmə eni metrikalarına (`wx`) qarşı qiymətləndirir, həqiqi boşluq simvollarını yalnız real söz fasilələri olan yerlərə daxil edir, sətir keçidlərindəki yumşaq ixtiyari defisləri isə silir.

Oxu sırasının bərpası: XY-Cut məkan maket alqoritmləri

Mürəkkəb çoxsütunlu sənədlərdən — akademik jurnal məqalələri, qəzet maketləri və ya korporativ balans hesabatları kimi — mətn çıxarmaq ciddi maket çətinlikləri yaradır. Proqram mətni səhifə boyunca sadəlövhcəsinə soldan sağa oxuyarsa, sütun sərhədlərini keçərək oxuyur, 1-ci sütunun cümlələrini birbaşa 2-ci sütunun cümlələri ilə birləşdirib anlaşılmaz cəfəngiyat yaradır.

Mühərrikimiz rekursiv XY-Cut məkan klasterləşdirmə alqoritmlərindən istifadə edir. O, hər mətn blokunun iki ölçülü sərhəd qutusu koordinatlarını təhlil edir, sütunlar arasındakı şaquli boşluq aralıqlarını müəyyən edir və səhifəni müstəqil oxu axını zonalarına bölür. 2-ci sütuna başlamazdan əvvəl 1-ci sütunu yuxarıdan aşağıya keçir və sonrakı təbii dil emalı (NLP) və LLM xülasələşdirməsi üçün təbii semantik davamlılığı qoruyur.

Sıfır bilikli yerli emal: məlumat axınları üçün mütləq məxfilik

Avtomatlaşdırılmış mətn çıxarması ən çox tələb olunan sənədlər həssas korporativ qeydlərdir: rüblük maliyyə hesabatları, idarə heyəti protokolları, məxfilik müqavilələri, məhkəmə çağırışları və məxfi işçi qeydləri. Bu xüsusi sənədləri ictimai bulud əsaslı çevirmə API-lərinə yükləmək korporativ məlumat rezidentliyi siyasətlərini pozur və təşkilatları ciddi sızma məsuliyyətlərinə məruz qoyur.

«PDF-dən düz mətn çıxar» alətimiz güzəştsiz brauzer tərəfli məlumat suverenliyi ilə işləyir. Saf WebAssembly və təcrid olunmuş Web Worker-lər əsasında bütün PDF təhlili, CMap həlli və mətn axını yaradılması ciddi şəkildə yerli brauzer tabınızda icra olunur. Fayllarınız heç vaxt xarici bulud serverlərinə toxunmur və ictimai şəbəkələri keçmir.

Düz mətn (.txt) və strukturlaşdırılmış JSON maket çıxarması

Müxtəlif məlumat mühəndisliyi iş axınları fərqli məlumat formatları tələb edir. İnsan oxucular və sadə mətn axtarış indeksləyiciləri təbii abzas sətir keçidləri olan təmiz, formatlanmış düz mətn (`.txt`) faylını üstün tutsa da, maşın öyrənmə axınları struktur metaməlumatı tələb edir.

Alətimiz hər iki ixrac rejimini dəstəkləyir: dərhal oxumaq üçün təmiz UTF-8 düz mətn endirin və ya dəqiq səhifə nömrələrini, sətir sərhəd qutularını `[x, y, width, height]`, şrift ailəsi adlarını, şrift ölçüsü metrikalarını və oxu sırası indekslərini ehtiva edən maşın tərəfindən oxuna bilən JSON iyerarxiyası ixrac edərək korporativ ETL axınlarına proqram inteqrasiyasını təmin edin.

💡Qüsursuz PDF mətn çıxarması üçün peşəkar tövsiyələr

  • •PDF-inizdən mətn kopyalamaq əvvəllər qəribə cəfəngiyat və ya simvollarla nəticələnibsə, alətimizin CMap /ToUnicode həlledicisi kodlaşdırmanı avtomatik düzəldəcək.
  • •Çoxsütunlu akademik məqalələr üçün XY-Cut alqoritmimiz mətnin cümlələri üfüqi qarışdırmaq əvəzinə sütun-sütun oxunmasını təmin edir.
  • •Python, Pandas və ya süni intellekt təlim dəstləri üçün məlumat çıxarma axınları qurursunuzsa, strukturlaşdırılmış JSON rejimində ixrac edin.
  • •Nəzərə alın ki, bu alət rəqəmsal vektor mətni çıxarır. PDF-iniz skan edilmiş fiziki kağızdan (bitmap şəkillər) ibarətdirsə, əvvəlcə optik simvol tanıma (OCR) tətbiq etməlisiniz.
  • •Əsas rəqəmlərin və terminlərin dəqiq tutulduğunu tez yoxlamaq üçün çıxarılmış mətn önizləməsində brauzerinizin axtarış qısayolundan (Ctrl+F / Cmd+F) istifadə edin.

🛡️Web Worker mətn qatı təhlili və CMap Unicode həlli

Mətn çıxarma axınımız Mozilla-nın PDF.js kitabxanasından istifadə edən sandbox Web Worker daxilində icra olunur. Worker PDF çarpaz istinad cədvəlini deşifrə edir, `/Pages` ağacını əldə edir və səhifə `/Contents` axınlarını yükləyir. O, dəqiq kətan koordinatlarını müəyyən etmək üçün Cari Transformasiya Matrisini (CTM) və Mətn Matrisini (`Tm`) izləyərək mətn operatorlarını (`BT`, `Tj`, `TJ`, `ET`) tokenləşdirir. Aktiv şrift lüğətinin `/ToUnicode` axınını qiymətləndirir, simvol kodlarını CMap BFH (BeginFontHeader) və BFRange xəritə cədvəlləri vasitəsilə standartlaşdırılmış UTF-16 kod vahidlərinə tərcümə edir. Liqaturalar parçalanır, sətir keçidi həddləri şrift irəliləmə enlərinə qarşı qiymətləndirilir və strukturlaşdırılmış mətn axınları tamamilə uçucu brauzer yaddaşında təmiz UTF-8 sətirlərinə seriyalaşdırılır.

Texnologiya: WebAssembly • Çoxaxınlı Web Workers • HTML5 Canvas API

Məxfilik: Fayllar cihazınızı tərk etmir və buludda saxlanmır; analitika yalnız razılığınızla işləyir.

Niyə brauzer əsaslı alətlər?

2run tools-da şəkli sıxdıqda və ya PDF birləşdirdikdə kod WebAssembly və Web Workers vasitəsilə brauzer tabınızda işləyir. Fayllarınızı heç vaxt uzaq serverə göndərmirik. Maliyyə hesabatlarınız, şəxsi fotolarınız və müqavilələriniz cihazınızı tərk etmir.

Tam məxfilikBrauzerdə
Ani emalSürətli RAM
Həqiqətən limitsizLimitsiz

PDF-lərdən mətn çıxarılması haqqında tez-tez verilən suallar

Niyə bəzi PDF-lərdən kopyalanan mətn qəribə simvollara və ya cəfəngiyata çevrilir?▾

Bu, PDF xüsusi qlif kodlaşdırmaları olan yerləşdirilmiş şrift alt dəstlərindən istifadə etdikdə və `/ToUnicode` xəritə cədvəli olmadıqda baş verir. Alətimiz bu xüsusi simvol kodlarını düzgün oxuna bilən Unicode mətninə tərcümə etmək üçün qabaqcıl CMap deşifrəçilərindən istifadə edir.

Bu alət skan edilmiş kağız sənədlərdən mətn çıxara bilərmi?▾

Bu alət PDF-ə yerləşdirilmiş yerli rəqəmsal mətni çıxarır. PDF-iniz altında rəqəmsal mətn qatı olmayan fiziki kağızın yalnız şəkil skanıdırsa, mətn simvollarını tanımaq üçün optik simvol tanıma (OCR) alətinə ehtiyacınız olacaq.

Bu alət çoxsütunlu oxu sırasını qoruyurmu?▾

Bəli! Mühərrikimiz mətn bloklarının iki ölçülü koordinatlarını təhlil edir və sütun aralıqlarını müəyyən edir, səhifə boyunca üfüqi oxumaq əvəzinə hər sütunu ardıcıl olaraq aşağıya doğru oxuyur.

Düz mətn və strukturlaşdırılmış JSON ixracı arasında fərq nədir?▾

Düz mətn (.txt) təbii abzas fasilələri olan təmiz, oxuna bilən mətn ixrac edir. Strukturlaşdırılmış JSON isə dəqiq X/Y səhifə koordinatları, şrift adları və şrift ölçüləri daxil olan mətn obyektləri massivi ixrac edir və tərtibatçılar və məlumat mühəndisləri üçün idealdır.

Məxfi fayllarım hər hansı xarici serverə yüklənirmi?▾

Heç vaxt. Bütün təhlil, qlif deşifrəsi və mətn yığılması 100% veb brauzerinizdə yerli olaraq baş verir. Şəxsi sənədləriniz heç vaxt fiziki cihazınızı tərk etmir.

Parolla qorunan PDF fayllarından mətn çıxara bilərəmmi?▾

PDF açılmaq üçün parol tələb edirsə, mətni çıxarmazdan əvvəl onu «Parollu PDF-in kilidini aç» alətimizlə açmalı və ya deşifrə etməlisiniz.

Mətni birbaşa smartfonumda və ya planşetimdə çıxara bilərəmmi?▾

Bəli! Alətimiz tamamilə brauzer tərəfli HTML5 və WebAssembly-də işləyir, tətbiq quraşdırması tələb etmədən mobil Safari, Chrome və Firefox-da problemsiz işləyir.

Alət 'fi' və 'fl' kimi liqaturaları avtomatik açırmı?▾

Bəli! Mühərrikimiz tipoqrafik liqaturaları avtomatik aşkarlayır və onları standart fərdi hərflərə ayırır, axtarış indeksləyicilərinin və mətn redaktorlarının sözləri düzgün tanımasını təmin edir.

0.8 saniyədən sürətli saytlar
100/100 Lighthouse veb mühəndisliyi
Yoxla
Dizayn agentlikləri üçün dev qolu
White-label • Qarşılıqlı NDA
Tərəfdaş
Kodla texniki SEO
Dərin Schema • Sıfır israf
SEO-nu böyüt
Fərdi veb tətbiqlər və SaaS
100% kod sahibliyi • Edge miqyası
Qur
Trafiki satışa çevirin
+34% satış artımı • Darboğazları düzəldin
Yoxla