PDF’dan oddiy matnni ajratish

PDF fayllardagi barcha matnni nusxalanadigan oddiy matnga chiqaring.

100% brauzerda • 100% bepul
📄

PDF’ni shu yerga tashlang yoki fayllarni koʻrib chiqing

Barcha ichki matnni brauzer xotirasida mahalliy ajratib oladi

Batafsil texnik qoʻllanma•8 daqiqalik oʻqish•2RUN Muhandislik jamoasi
100% brauzerda • Yuklashsiz

PDF’dan onlayn matn ajratish: PDF’ni TXT’ga aylantirish, CMap glif dekodlash va brauzerda PDF.js

⚡3 oddiy qadamda PDF’dan matnni qanday ajratib olish mumkin

1

1. Maqsadli PDF’ingizni import qiling

PDF’ingizni tanlang yoki xavfsiz ish maydoniga sudrab olib keling. Fayl nol server yuklash bilan brauzer RAM’ida mahalliy tahlil qilinadi.

2

2. Chiqish formati va parametrlarini tanlang

Oʻqiladigan matn uchun 'Oddiy matn (.txt)' yoki koordinata chegara qutilari va shrift metamaʼlumotlarini saqlash uchun 'Tuzilgan JSON' ni tanlang.

3

3. Darhol ajrating va yuklab oling

Brauzer tomonidagi fazoviy tahlilni bajarish uchun 'Matnni ajratish' tugmasini bosing. Ajratilgan matnni toʻgʻridan-toʻgʻri buferga nusxalang yoki matn faylini yuklab oling.

Zamonaviy maʼlumotlar muhandisligi, tabiiy tilni qayta ishlash (NLP), huquqiy elektron dalil qidiruvi va akademik tadqiqotlarda PDF hujjatlardan toza, buzilmagan oddiy matnni ajratib olish maʼlumot qabul qilishning asosiy birinchi qadamidir. Tashkilotlar Portable Document Format ichida qulflangan minglab raqamli shartnomalar, moliyaviy balans hisobotlari, meʼyoriy oq hujjatlar va tadqiqot ishlarini oladi. Biroq PDF matn muharriri hujjati emas; u matnni oddiy uzluksiz gaplar yoki paragraflar sifatida saqlamaydi. Aksincha, PDF alohida tipografik gliflarni ikki oʻlchamli kanvasda ixtiyoriy matematik koordinatalarda joylashtiradigan murakkab vizual koʻrsatmalar toʻplamidir.

Brauzerga asoslangan «PDF’dan oddiy matnni ajratish» vositamiz korporativ darajadagi matn ajratishni toʻgʻridan-toʻgʻri veb brauzeringizda taqdim etadi. Mozilla’ning sanoat standarti boʻlgan PDF.js render mexanizmi va izolyatsiyalangan Web Worker’lar asosida ishlaydigan tizimimiz hujjat kontent oqimlarini tahlil qiladi, murakkab Character Map (CMap) kodlash jadvallarini hal qiladi, tipografik ligaturalarni yoyadi va tabiiy inson oʻqish tartibini qayta tiklaydi. Bir necha soniyada toza, formatlangan UTF-8 oddiy matn (.txt) yoki subpiksel chegara qutisi koordinatalariga ega tuzilgan JSON maket jadvallarini eksport qiling. Eng muhimi, barcha hisob-kitoblar 100% brauzer xotirangizda mahalliy bajariladi: maxfiy moliyaviy auditlaringiz, bemor kartalari va xususiy tadqiqotlaringiz hech qachon tashqi serverlarga tegmaydi.

Toʻliq texnik qoʻllanmani oʻqish

Oddiy matn illyuziyasi: PDF’lar tipografiyani aslida qanday saqlaydi

Koʻplab kompyuter foydalanuvchilari PDF matnni Microsoft Word yoki HTML kabi paragraflar, gaplar va soʻzlar shaklida saqlaydi deb xato oʻylaydi. Aslida ISO 32000 spetsifikatsiyasiga koʻra PDF PostScript’dan kelib chiqqan vizual maket tilidir. Matn `/Contents` oqimlari ichidagi past darajali chizish operatorlari yordamida chiziladi.

Mualliflik dasturi sarlavhani quyidagini chiqarib chizishi mumkin: `BT /F1 12 Tf 72 712 Td [(C) 12 (o) -4 (r) 8 (p)] TJ ET`. Eʼtibor bering, harflar alohida kerning tuzatishlari bilan joylashtiriladi; soʻzlarda hatto boʻsh joy belgilari (`0x20`) boʻlmasligi, oʻrniga katta manfiy gorizontal siljishlar boʻlishi mumkin. Bundan tashqari, matn elementlari fayl binarida xronologik tartibdan tashqari saqlanishi mumkin — pastki kolontitul qatori asosiy sarlavhadan oldin tahlil qilinishi mumkin. Haqiqiy matn ajratish tarqoq glif koordinatalarini izchil, oʻqiladigan paragraflarga yigʻish uchun murakkab fazoviy tiklash evristikalarini talab qiladi.

Belgilar xaritalari (CMap) va /ToUnicode tarjima jadvali

PDF matn ajratishdagi eng keng tarqalgan va chalkash muammolardan biri — hujjatdan matnni nusxalab, uni gʻalati maʼnosiz belgilar, soʻroq belgilari yoki chop etilmaydigan qutilar sifatida joylashtirish. Bu halokatli xato PDF toʻgʻri `/ToUnicode` xarita jadvalisiz maxsus shrift qism toʻplami kodlashlaridan foydalanganda yuz beradi.

Optimallashtirilgan PDF’larda shriftlar qism toʻplamlarga ajratiladi: kontent oqimidagi belgi kodlari (masalan, `0x01`, `0x02` bayti) standart ASCII yoki Unicode’ga mos kelmaydi. Aksincha, ular shrift dasturi ichidagi ixtiyoriy glif indekslarini ifodalaydi. Mos PDF ajratgichlar shriftning `/ToUnicode` CMap oqimiga — belgi kodlarini standartlashtirilgan UTF-16 Unicode qiymatlariga moslashtiradigan tarjima lugʻatiga — tayanadi. Brauzer tomonidagi mexanizmimiz joylashtirilgan CMap jadvallari, Adobe standart kodlashlari (WinAnsi, MacRoman) va kompozit Type 0 CIDFont jadvallarini chuqur tahlil qilib, xalqaro alifbolar boʻylab aniq Unicode aylantirishni kafolatlaydi.

Tipografik ligaturalar, defis bilan koʻchirish va soʻz chegaralarini aniqlash

Professional nashriyot tipografiyasi ligaturalardan — seriflar orasidagi noqulay toʻqnashuvlarning oldini olish uchun qoʻshni belgilar yagona vizual dizaynga birlashadigan birlashgan gliflardan ('fi', 'fl', 'ffi', 'ffl' va 'st' kabi) — foydalanadi. Optimallashtirilmagan ajratgichlarda 'financial' soʻzini nusxalash 'nancial' yoki 'fi nancial' bilan yakunlanadi, chunki ligatura glifining 1 ga 1 ASCII moslashuvi yoʻq.

Mexanizmimiz avtomatlashtirilgan ligaturani parchalashni taqdim etadi. U kompozit Unicode belgilarini ('fi' uchun `U+FB01` va 'fl' uchun `U+FB02` kabi) aniqlaydi va ularni alohida tarkibiy belgilariga ('f' + 'i') yoyadi. Bundan tashqari, mexanizm soʻzlararo fazoviy masofalarni shrift ilgarilash kengligi metrikalariga (`wx`) nisbatan baholaydi, haqiqiy boʻsh joy belgilarini faqat haqiqiy soʻz uzilishlari mavjud joylarga qoʻyadi, qator koʻchishlaridagi yumshoq ixtiyoriy defislarni esa olib tashlaydi.

Oʻqish tartibini tiklash: XY-Cut fazoviy maket algoritmlari

Murakkab koʻp ustunli hujjatlardan — akademik jurnal maqolalari, gazeta maketlari yoki korporativ balans hisobotlari kabi — matn ajratish jiddiy maket qiyinchiliklarini keltirib chiqaradi. Agar dastur matnni sahifa boʻylab soddalik bilan chapdan oʻngga oʻqisa, u ustun chegaralarini kesib oʻtadi, 1-ustun gaplarini toʻgʻridan-toʻgʻri 2-ustun gaplari bilan birlashtirib, tushunarsiz maʼnosiz matn hosil qiladi.

Mexanizmimiz rekursiv XY-Cut fazoviy klasterlash algoritmlaridan foydalanadi. U har bir matn blokining ikki oʻlchamli chegara qutisi koordinatalarini tahlil qiladi, ustunlar orasidagi vertikal boʻsh oraliqlarni aniqlaydi va sahifani mustaqil oʻqish oqimi zonalariga ajratadi. 2-ustunni boshlashdan oldin 1-ustunni yuqoridan pastga oʻtadi va keyingi tabiiy tilni qayta ishlash (NLP) hamda LLM xulosalash uchun tabiiy semantik uzluksizlikni saqlaydi.

Nol bilimli mahalliy ishlov: maʼlumotlar jarayonlari uchun mutlaq maxfiylik

Avtomatlashtirilgan matn ajratish eng koʻp talab qilinadigan hujjatlar nozik korporativ yozuvlardir: choraklik moliyaviy hisobotlar, boshqaruv kengashi bayonnomalari, oshkor qilmaslik shartnomalari, sud chaqiruvlari va maxfiy xodimlar yozuvlari. Bu xususiy hujjatlarni ommaviy bulutga asoslangan aylantirish API’lariga yuklash korporativ maʼlumotlar rezidentligi siyosatlarini buzadi va tashkilotlarni jiddiy sizib chiqish javobgarligiga duchor qiladi.

«PDF’dan oddiy matnni ajratish» vositamiz murosasiz brauzer tomonidagi maʼlumotlar suvereniteti bilan ishlaydi. Sof WebAssembly va izolyatsiyalangan Web Worker’lar asosida barcha PDF tahlili, CMap hal qilish va matn oqimini yaratish qatʼiy ravishda mahalliy brauzer yorligʻingiz ichida bajariladi. Fayllaringiz hech qachon tashqi bulut serverlariga tegmaydi va ommaviy tarmoqlarni kesib oʻtmaydi.

Oddiy matn (.txt) va tuzilgan JSON maket ajratish

Turli maʼlumotlar muhandisligi ish oqimlari turli maʼlumot formatlarini talab qiladi. Inson oʻquvchilar va oddiy matn qidiruv indekslagichlari tabiiy paragraf qator uzilishlariga ega toza, formatlangan oddiy matn (`.txt`) faylini afzal koʻrsa-da, mashinali oʻrganish jarayonlari tuzilmaviy metamaʼlumotlarni talab qiladi.

Vositamiz ikkala eksport rejimini qoʻllab-quvvatlaydi: darhol oʻqish uchun toza UTF-8 oddiy matnni yuklab oling yoki aniq sahifa raqamlari, qator chegara qutilari `[x, y, width, height]`, shrift oilasi nomlari, shrift oʻlchami metrikalari va oʻqish tartibi indekslarini oʻz ichiga olgan mashina oʻqiy oladigan JSON ierarxiyasini eksport qilib, korporativ ETL jarayonlariga dasturiy integratsiyani taʼminlang.

💡Benuqson PDF matn ajratish uchun professional maslahatlar

  • •Agar PDF’ingizdan matn nusxalash avval gʻalati maʼnosiz matn yoki belgilarga olib kelgan boʻlsa, vositamizning CMap /ToUnicode hal qiluvchisi kodlashni avtomatik tuzatadi.
  • •Koʻp ustunli akademik maqolalar uchun XY-Cut algoritmimiz matn gaplarni gorizontal aralashtirish oʻrniga ustunma-ustun oʻqilishini taʼminlaydi.
  • •Agar Python, Pandas yoki sunʼiy intellekt oʻqitish toʻplamlari uchun maʼlumot ajratish jarayonlarini qurayotgan boʻlsangiz, tuzilgan JSON rejimida eksport qiling.
  • •Eʼtibor bering, bu vosita raqamli vektor matnni ajratadi. Agar PDF’ingiz skanerlangan jismoniy qogʻozdan (bitmap rasmlar) iborat boʻlsa, avval optik belgilarni tanish (OCR) ni qoʻllashingiz kerak.
  • •Asosiy raqamlar va atamalar aniq olinganini tezda tekshirish uchun ajratilgan matn oldindan koʻrinishida brauzeringizning qidiruv yorligʻidan (Ctrl+F / Cmd+F) foydalaning.

🛡️Web Worker matn qatlami tahlili va CMap Unicode hal qilish

Matn ajratish jarayonimiz Mozilla’ning PDF.js kutubxonasidan foydalanadigan izolyatsiyalangan Web Worker ichida bajariladi. Worker PDF oʻzaro havolalar jadvalini dekodlaydi, `/Pages` daraxtini oladi va sahifa `/Contents` oqimlarini yuklaydi. U aniq kanvas koordinatalarini aniqlash uchun Joriy transformatsiya matritsasi (CTM) va Matn matritsasini (`Tm`) kuzatib, matn operatorlarini (`BT`, `Tj`, `TJ`, `ET`) tokenlaydi. Faol shrift lugʻatining `/ToUnicode` oqimini baholaydi va belgi kodlarini CMap BFH (BeginFontHeader) va BFRange xarita jadvallari orqali standartlashtirilgan UTF-16 kod birliklariga tarjima qiladi. Ligaturalar parchalanadi, qator uzilishi chegaralari shrift ilgarilash kengliklariga nisbatan baholanadi va tuzilgan matn oqimlari butunlay oʻzgaruvchan brauzer xotirasida toza UTF-8 satrlariga serializatsiya qilinadi.

Texnologiya: WebAssembly • Koʻp oqimli Web Workers • HTML5 Canvas API

Maxfiylik: Fayllar qurilmangizni tark etmaydi va bulutda saqlanmaydi; analitika faqat roziligingiz bilan ishlaydi.

Nega brauzerdagi vositalar?

2run tools’da rasmni siqqaningizda yoki PDF birlashtirganingizda kod WebAssembly va Web Workers yordamida brauzer oynangiz ichida ishlaydi. Biz hech qachon fayllaringizni uzoq serverga yubormaymiz. Moliyaviy hisobotlaringiz, shaxsiy suratlaringiz va shartnomalaringiz qurilmangizni tark etmaydi.

Toʻliq maxfiylikBrauzerda
Bir zumda ishlovTezkor RAM
Haqiqatan cheksizCheksiz

PDF’lardan matn ajratish haqida tez-tez beriladigan savollar

Nima uchun baʼzi PDF’lardan nusxalangan matn gʻalati belgilar yoki maʼnosiz matnga aylanadi?▾

Bu PDF maxsus glif kodlashlariga ega joylashtirilgan shrift qism toʻplamlaridan foydalanganda va `/ToUnicode` xarita jadvali boʻlmaganda yuz beradi. Vositamiz bu maxsus belgi kodlarini toʻgʻri oʻqiladigan Unicode matniga tarjima qilish uchun ilgʻor CMap dekoderlaridan foydalanadi.

Bu vosita skanerlangan qogʻoz hujjatlardan matn ajrata oladimi?▾

Bu vosita PDF’ga joylashtirilgan mahalliy raqamli matnni ajratadi. Agar PDF’ingiz ostida raqamli matn qatlami boʻlmagan jismoniy qogʻozning faqat rasmli skani boʻlsa, matn belgilarini tanish uchun optik belgilarni tanish (OCR) vositasi kerak boʻladi.

Bu vosita koʻp ustunli oʻqish tartibini saqlaydimi?▾

Ha! Mexanizmimiz matn bloklarining ikki oʻlchamli koordinatalarini tahlil qiladi va ustun oraliqlarini aniqlaydi, sahifa boʻylab gorizontal oʻqish oʻrniga har bir ustunni ketma-ket pastga qarab oʻqiydi.

Oddiy matn va tuzilgan JSON eksporti oʻrtasidagi farq nima?▾

Oddiy matn (.txt) tabiiy paragraf uzilishlariga ega toza, oʻqiladigan matnni eksport qiladi. Tuzilgan JSON esa aniq X/Y sahifa koordinatalari, shrift nomlari va shrift oʻlchamlarini oʻz ichiga olgan matn obyektlari massivini eksport qiladi va dasturchilar hamda maʼlumotlar muhandislari uchun ideal.

Maxfiy fayllarim biror tashqi serverga yuklanadimi?▾

Hech qachon. Barcha tahlil, glif dekodlash va matnni yigʻish 100% veb brauzeringizda mahalliy amalga oshiriladi. Shaxsiy hujjatlaringiz hech qachon jismoniy qurilmangizni tark etmaydi.

Parol bilan himoyalangan PDF fayllardan matn ajrata olamanmi?▾

Agar PDF ochish uchun parol talab qilsa, matnni ajratishdan oldin uni avval «Parolli PDF qulfini ochish» vositamiz bilan ochishingiz yoki shifrdan chiqarishingiz kerak.

Matnni toʻgʻridan-toʻgʻri smartfonim yoki planshetimda ajrata olamanmi?▾

Ha! Vositamiz butunlay brauzer tomonidagi HTML5 va WebAssembly’da ishlaydi va ilova oʻrnatishni talab qilmasdan mobil Safari, Chrome va Firefox’da muammosiz ishlaydi.

Vosita 'fi' va 'fl' kabi ligaturalarni avtomatik yoyadimi?▾

Ha! Mexanizmimiz tipografik ligaturalarni avtomatik aniqlaydi va ularni standart alohida harflarga ajratadi, bu qidiruv indekslagichlari va matn muharrirlarining soʻzlarni toʻgʻri tanishini taʼminlaydi.

0.8 soniyadan tez saytlar
100/100 Lighthouse veb muhandislik
Tekshirish
Dizayn agentliklari uchun dasturlash
White-label • Ikki tomonlama NDA
Hamkorlik
Kod orqali texnik SEO
Chuqur Schema • Isrofsiz
SEO’ni oshirish
Maxsus veb-ilovalar va SaaS
100% kodga egalik • Edge masshtabi
Yaratish
Trafikni savdoga aylantiring
+34% savdo oʻsishi • Toʻsiqlarni tuzatish
Tekshirish