استخراج متن ساده از PDF

تمام محتوای متنی فایل‌های PDF را به متن ساده قابل کپی استخراج کنید.

۱۰۰٪ در مرورگر • ۱۰۰٪ رایگان
📄

PDF را اینجا رها کنید یا فایل‌ها را مرور کنید

همه متن جاسازی‌شده را به‌صورت محلی در حافظه مرورگر استخراج می‌کند

راهنمای فنی جامع•۸ دقیقه مطالعه•تیم مهندسی 2RUN
۱۰۰٪ در مرورگر • بدون آپلود

استخراج آنلاین متن از PDF: تبدیل PDF به TXT، رمزگشایی گلیف CMap و PDF.js درون مرورگر

⚡چگونه در ۳ گام ساده متن را از PDF استخراج کنیم

1

۱. PDF هدف خود را وارد کنید

PDF خود را انتخاب کنید یا به فضای کاری امن بکشید. فایل به‌صورت محلی در RAM مرورگر و بدون هیچ آپلودی به سرور تجزیه می‌شود.

2

۲. قالب خروجی و گزینه‌ها را انتخاب کنید

برای متن خوانا 'متن ساده (.txt)' یا برای حفظ کادرهای محدودکننده مختصات و فراداده فونت 'JSON ساختاریافته' را انتخاب کنید.

3

۳. فوراً استخراج و دانلود کنید

روی 'استخراج متن' کلیک کنید تا تجزیه فضایی سمت کاربر اجرا شود. متن استخراج‌شده را مستقیماً در کلیپ‌بورد کپی یا فایل متنی را دانلود کنید.

در مهندسی داده مدرن، پردازش زبان طبیعی (NLP)، کشف الکترونیکی حقوقی و پژوهش دانشگاهی، استخراج متن ساده تمیز و سالم از اسناد PDF نخستین گام بنیادین در دریافت اطلاعات است. سازمان‌ها هزاران قرارداد دیجیتال، ترازنامه مالی، گزارش سفید نظارتی و مطالعه پژوهشی را دریافت می‌کنند که درون قالب Portable Document Format قفل شده‌اند. اما PDF یک سند واژه‌پرداز نیست؛ متن را به‌صورت جمله‌ها یا پاراگراف‌های پیوسته ساده ذخیره نمی‌کند. در عوض، PDF یک مجموعه دستورالعمل بصری پیچیده است که گلیف‌های تایپوگرافی را تک‌تک در مختصات ریاضی دلخواه روی یک بوم دوبعدی قرار می‌دهد.

ابزار «استخراج متن ساده از PDF» مبتنی بر مرورگر ما استخراج متن در سطح سازمانی را مستقیماً درون مرورگر وب شما فراهم می‌کند. سیستم ما با تکیه بر موتور رندر استاندارد صنعتی PDF.js از Mozilla و Web Workerهای ایزوله، جریان‌های محتوای سند را تجزیه، جدول‌های رمزگذاری پیچیده Character Map ‏(CMap) را حل، لیگاتورهای تایپوگرافی را باز و ترتیب خواندن طبیعی انسانی را بازسازی می‌کند. در چند ثانیه متن ساده UTF-8 تمیز و قالب‌بندی‌شده (.txt) یا جدول‌های چیدمان JSON ساختاریافته با مختصات کادر محدودکننده زیرپیکسلی خروجی بگیرید. نکته حیاتی اینکه همه محاسبات ۱۰۰٪ به‌صورت محلی در حافظه مرورگر شما اجرا می‌شوند: حسابرسی‌های مالی محرمانه، پرونده‌های بیماران و پژوهش‌های اختصاصی شما هرگز به سرورهای خارجی نمی‌رسند.

خواندن راهنمای فنی کامل

توهم متن ساده: PDFها در واقع تایپوگرافی را چگونه ذخیره می‌کنند

بسیاری از کاربران رایانه به اشتباه تصور می‌کنند PDF متن را مانند Microsoft Word یا HTML به‌صورت پاراگراف، جمله و واژه ذخیره می‌کند. در واقعیت، طبق مشخصات ISO 32000، ‏PDF یک زبان چیدمان بصری برآمده از PostScript است. متن با عملگرهای ترسیم سطح پایین درون جریان‌های `/Contents` رندر می‌شود.

یک برنامه تألیف ممکن است یک سرفصل را با خروجی زیر رندر کند: `BT /F1 12 Tf 72 712 Td [(C) 12 (o) -4 (r) 8 (p)] TJ ET`. توجه کنید که حروف با تنظیمات کرنینگ جداگانه جای‌گذاری می‌شوند؛ واژه‌ها ممکن است حتی نویسه فاصله (`0x20`) نداشته باشند و به‌جای آن جابه‌جایی‌های افقی منفی بزرگ داشته باشند. افزون بر این، عناصر متنی می‌توانند خارج از ترتیب زمانی در باینری فایل ذخیره شوند — ممکن است یک خط پاصفحه پیش از تیتر اصلی تجزیه شود. استخراج واقعی متن نیازمند الگوریتم‌های ابتکاری پیچیده بازسازی فضایی است تا مختصات پراکنده گلیف‌ها را به پاراگراف‌های منسجم و خوانا تبدیل کند.

نقشه‌های نویسه (CMap) و جدول ترجمه /ToUnicode

یکی از رایج‌ترین و گیج‌کننده‌ترین مشکلات استخراج متن از PDF این است که متنی را از سند کپی کنید و هنگام چسباندن به نمادهای عجیب و نامفهوم، علامت سؤال یا کادرهای غیرقابل چاپ تبدیل شود. این خطای فاجعه‌بار زمانی رخ می‌دهد که PDF از رمزگذاری‌های زیرمجموعه فونت سفارشی بدون جدول نگاشت `/ToUnicode` مناسب استفاده کند.

در PDFهای بهینه‌شده، فونت‌ها زیرمجموعه‌سازی می‌شوند: کدهای نویسه در جریان محتوا (مثلاً بایت `0x01`، `0x02`) با ASCII یا Unicode استاندارد مطابقت ندارند. بلکه نمایانگر شاخص‌های دلخواه گلیف درون برنامه فونت هستند. استخراج‌کننده‌های سازگار PDF به جریان CMap ‏`/ToUnicode` فونت تکیه می‌کنند — واژه‌نامه ترجمه‌ای که کدهای نویسه را به مقادیر استاندارد UTF-16 Unicode نگاشت می‌کند. موتور سمت کاربر ما جدول‌های CMap جاسازی‌شده، رمزگذاری‌های استاندارد Adobe ‏(WinAnsi، ‏MacRoman) و جدول‌های مرکب Type 0 CIDFont را عمیقاً تجزیه می‌کند و تبدیل دقیق Unicode را در الفباهای بین‌المللی تضمین می‌کند.

لیگاتورهای تایپوگرافی، خط‌تیره‌گذاری و تشخیص مرز واژه‌ها

تایپوگرافی حرفه‌ای نشر از لیگاتورها استفاده می‌کند — گلیف‌های ترکیبی که در آن‌ها نویسه‌های مجاور در یک طرح بصری واحد ادغام می‌شوند (مانند 'fi'، 'fl'، 'ffi'، 'ffl' و 'st') تا از برخورد ناخوشایند سریف‌ها جلوگیری شود. در استخراج‌کننده‌های بهینه‌نشده، کپی کردن واژه 'financial' به 'nancial' یا 'fi nancial' منجر می‌شود، زیرا گلیف لیگاتور نگاشت یک‌به‌یک ASCII ندارد.

موتور ما تجزیه خودکار لیگاتور را ارائه می‌دهد. نویسه‌های مرکب Unicode ‏(مانند `U+FB01` برای 'fi' و `U+FB02` برای 'fl') را شناسایی و آن‌ها را به نویسه‌های تشکیل‌دهنده جداگانه‌شان ('f' + 'i') باز می‌کند. افزون بر این، موتور فاصله‌های فضایی میان واژه‌ها را با معیارهای عرض پیشروی فونت (`wx`) می‌سنجد، نویسه‌های فاصله واقعی را تنها جایی درج می‌کند که شکست واقعی واژه وجود دارد و خط‌تیره‌های نرم اختیاری را در شکست خطوط حذف می‌کند.

بازسازی ترتیب خواندن: الگوریتم‌های چیدمان فضایی XY-Cut

استخراج متن از اسناد پیچیده چندستونه — مانند مقاله‌های مجلات دانشگاهی، چیدمان روزنامه‌ها یا ترازنامه‌های شرکتی — چالش‌های جدی چیدمان ایجاد می‌کند. اگر نرم‌افزار متن را ساده‌لوحانه از چپ به راست در عرض صفحه بخواند، از مرز ستون‌ها عبور می‌کند و جمله‌های ستون ۱ را مستقیماً با جمله‌های ستون ۲ ادغام کرده و متنی نامفهوم می‌سازد.

موتور ما از الگوریتم‌های بازگشتی خوشه‌بندی فضایی XY-Cut استفاده می‌کند. مختصات دوبعدی کادر محدودکننده هر بلوک متنی را تحلیل، فاصله‌های سفید عمودی میان ستون‌ها را شناسایی و صفحه را به مناطق جریان خواندن مستقل تقسیم می‌کند. پیش از آغاز ستون ۲، ستون ۱ را از بالا به پایین پیمایش می‌کند و پیوستگی معنایی طبیعی را برای پردازش زبان طبیعی (NLP) و خلاصه‌سازی با LLM در مراحل بعدی حفظ می‌کند.

پردازش محلی با دانش صفر: محرمانگی مطلق برای خط لوله‌های داده

اسنادی که بیشترین نیاز به استخراج خودکار متن دارند سوابق حساس سازمانی‌اند: گزارش‌های مالی فصلی، صورت‌جلسه‌های هیئت‌مدیره، قراردادهای عدم افشا، احضاریه‌های دعاوی و سوابق محرمانه کارکنان. آپلود این اسناد اختصاصی به APIهای تبدیل ابری عمومی سیاست‌های اقامت داده سازمانی را نقض می‌کند و سازمان‌ها را در معرض مسئولیت‌های جدی نشت داده قرار می‌دهد.

ابزار «استخراج متن ساده از PDF» ما با حاکمیت داده سمت کاربر بی‌چون‌وچرا کار می‌کند. با تکیه بر WebAssembly خالص و Web Workerهای ایزوله، همه تجزیه PDF، حل CMap و تولید جریان متن صرفاً درون زبانه محلی مرورگر شما اجرا می‌شوند. فایل‌های شما هرگز به سرورهای ابری خارجی نمی‌رسند و از شبکه‌های عمومی عبور نمی‌کنند.

متن ساده (.txt) در برابر استخراج چیدمان JSON ساختاریافته

گردش‌کارهای مختلف مهندسی داده به قالب‌های داده متفاوتی نیاز دارند. در حالی که خوانندگان انسانی و نمایه‌سازهای ساده جست‌وجوی متن یک فایل متن ساده (`.txt`) تمیز و قالب‌بندی‌شده با شکست خطوط طبیعی پاراگراف را ترجیح می‌دهند، خط لوله‌های یادگیری ماشین به فراداده ساختاری نیاز دارند.

ابزار ما از هر دو حالت خروجی پشتیبانی می‌کند: متن ساده UTF-8 تمیز را برای خواندن فوری دانلود کنید، یا یک سلسله‌مراتب JSON قابل خواندن برای ماشین شامل شماره دقیق صفحات، کادرهای محدودکننده خطوط `[x, y, width, height]`، نام خانواده فونت‌ها، معیارهای اندازه فونت و شاخص‌های ترتیب خواندن خروجی بگیرید و یکپارچه‌سازی برنامه‌نویسی در خط لوله‌های ETL سازمانی را ممکن سازید.

💡نکات حرفه‌ای برای استخراج بی‌نقص متن از PDF

  • •اگر کپی کردن متن از PDF شما پیش‌تر به نمادها یا متن نامفهوم عجیب منجر می‌شد، حل‌کننده CMap /ToUnicode ابزار ما رمزگذاری را خودکار اصلاح می‌کند.
  • •برای مقاله‌های دانشگاهی چندستونه، الگوریتم XY-Cut ما تضمین می‌کند متن ستون به ستون خوانده شود نه اینکه جمله‌ها به‌صورت افقی درهم شوند.
  • •اگر خط لوله‌های استخراج داده برای Python، ‏Pandas یا مجموعه‌های آموزش هوش مصنوعی می‌سازید، در حالت JSON ساختاریافته خروجی بگیرید.
  • •توجه داشته باشید که این ابزار متن وکتوری دیجیتال را استخراج می‌کند. اگر PDF شما از کاغذ فیزیکی اسکن‌شده (تصاویر بیت‌مپ) تشکیل شده، ابتدا باید نویسه‌خوان نوری (OCR) را اعمال کنید.
  • •از میان‌بر جست‌وجوی مرورگر (Ctrl+F / Cmd+F) روی پیش‌نمایش متن استخراج‌شده استفاده کنید تا سریع تأیید کنید اعداد و اصطلاحات کلیدی دقیق ثبت شده‌اند.

🛡️تجزیه لایه متن در Web Worker و حل Unicode با CMap

خط لوله استخراج متن ما درون یک Web Worker در سندباکس و با کتابخانه PDF.js از Mozilla اجرا می‌شود. Worker جدول ارجاع متقابل PDF را رمزگشایی، درخت `/Pages` را بازیابی و جریان‌های `/Contents` صفحات را بارگذاری می‌کند. عملگرهای متنی (`BT`، `Tj`، `TJ`، `ET`) را توکن‌سازی می‌کند و ماتریس تبدیل جاری (CTM) و ماتریس متن (`Tm`) را برای تعیین مختصات دقیق بوم ردیابی می‌کند. جریان `/ToUnicode` واژه‌نامه فونت فعال را ارزیابی و کدهای نویسه را از طریق جدول‌های نگاشت CMap ‏BFH ‏(BeginFontHeader) و BFRange به واحدهای کد استاندارد UTF-16 ترجمه می‌کند. لیگاتورها تجزیه، آستانه‌های شکست خط در برابر عرض‌های پیشروی فونت سنجیده و اجراهای متنی ساختاریافته کاملاً در حافظه فرّار مرورگر به رشته‌های UTF-8 تمیز سریال‌سازی می‌شوند.

فناوری: WebAssembly • Web Workers چندرشته‌ای • HTML5 Canvas API

حریم خصوصی: فایل‌ها از دستگاه شما خارج نمی‌شوند و در فضای ابری ذخیره نمی‌شوند؛ آمار فقط با رضایت شما اجرا می‌شود.

چرا ابزارهای مبتنی بر مرورگر؟

وقتی در 2run tools تصویری را فشرده یا PDFی را ادغام می‌کنید، کد با استفاده از WebAssembly و Web Workers داخل زبانه مرورگر شما اجرا می‌شود. ما هرگز فایل‌های شما را به سرور دوردست ارسال نمی‌کنیم. گزارش‌های مالی، عکس‌های شخصی و قراردادهای شما از دستگاهتان خارج نمی‌شوند.

حریم خصوصی کاملدر مرورگر
پردازش فوریرم سریع
واقعاً نامحدودبدون محدودیت

پرسش‌های متداول درباره استخراج متن از PDF

چرا متن کپی‌شده از برخی PDFها به نمادهای عجیب یا متن نامفهوم تبدیل می‌شود؟▾

این زمانی رخ می‌دهد که PDF از زیرمجموعه‌های فونت جاسازی‌شده با رمزگذاری‌های گلیف سفارشی استفاده کند و جدول نگاشت `/ToUnicode` نداشته باشد. ابزار ما از رمزگشاهای پیشرفته CMap برای ترجمه این کدهای نویسه سفارشی به متن Unicode خوانای صحیح استفاده می‌کند.

آیا این ابزار می‌تواند متن را از اسناد کاغذی اسکن‌شده استخراج کند؟▾

این ابزار متن دیجیتال بومی جاسازی‌شده در PDF را استخراج می‌کند. اگر PDF شما اسکن تصویری صرف از کاغذ فیزیکی بدون لایه متن دیجیتال زیرین است، برای شناسایی نویسه‌های متن به یک ابزار نویسه‌خوان نوری (OCR) نیاز دارید.

آیا این ابزار ترتیب خواندن چندستونه را حفظ می‌کند؟▾

بله! موتور ما مختصات دوبعدی بلوک‌های متنی را تحلیل و فاصله‌های میان ستون‌ها را شناسایی می‌کند و به‌جای خواندن افقی در عرض صفحه، هر ستون را به‌ترتیب از بالا به پایین می‌خواند.

تفاوت خروجی متن ساده و JSON ساختاریافته چیست؟▾

متن ساده (.txt) متن تمیز و خوانا با شکست‌های طبیعی پاراگراف خروجی می‌دهد. JSON ساختاریافته آرایه‌ای از اشیای متنی شامل مختصات دقیق X/Y صفحه، نام فونت‌ها و اندازه فونت‌ها خروجی می‌دهد که برای توسعه‌دهندگان و مهندسان داده ایده‌آل است.

آیا فایل‌های محرمانه من در سرور خارجی آپلود می‌شوند؟▾

هرگز. همه تجزیه، رمزگشایی گلیف و سرهم‌سازی متن ۱۰۰٪ به‌صورت محلی در مرورگر وب شما انجام می‌شوند. اسناد خصوصی شما هرگز دستگاه فیزیکی‌تان را ترک نمی‌کنند.

آیا می‌توانم از فایل‌های PDF محافظت‌شده با رمز متن استخراج کنم؟▾

اگر PDF برای باز شدن رمز لازم دارد، باید پیش از استخراج متن ابتدا آن را با ابزار «باز کردن قفل PDF رمزدار» ما باز یا رمزگشایی کنید.

آیا می‌توانم متن را مستقیماً روی گوشی هوشمند یا تبلت خود استخراج کنم؟▾

بله! ابزار ما کاملاً در HTML5 و WebAssembly سمت کاربر اجرا می‌شود و بدون نیاز به نصب اپلیکیشن، به‌خوبی در Safari، ‏Chrome و Firefox موبایل کار می‌کند.

آیا ابزار لیگاتورهایی مانند 'fi' و 'fl' را خودکار باز می‌کند؟▾

بله! موتور ما لیگاتورهای تایپوگرافی را خودکار تشخیص می‌دهد و آن‌ها را به حروف جداگانه استاندارد تفکیک می‌کند تا نمایه‌سازهای جست‌وجو و واژه‌پردازها واژه‌ها را درست تشخیص دهند.

سایت‌هایی با بارگذاری زیر ۰٫۸ ثانیه
مهندسی وب با امتیاز ۱۰۰/۱۰۰ Lighthouse
بررسی
بازوی توسعه برای آژانس‌های طراحی
White-label • NDA دوطرفه
همکاری
سئوی فنی با کد
Schema عمیق • بدون هدررفت
گسترش سئو
وب‌اپ‌ها و SaaS سفارشی
مالکیت ۱۰۰٪ کد • مقیاس Edge
ساخت
بازدید را به فروش تبدیل کنید
+۳۴٪ افزایش فروش • رفع گلوگاه‌ها
بررسی