استخراج آنلاین صفحات PDF: ذخیره صفحات انتخابی بهعنوان سند PDF جدید و PDF-Lib
⚡چگونه صفحات را از یک PDF در مرورگر استخراج کنیم
سند PDF اصلی خود را وارد کنید
PDF خود را به ناحیه آپلود بکشید یا برای انتخاب از دستگاه کلیک کنید. ویرایشگر سند را تجزیه و تصاویر بندانگشتی صفحات را نمایش میدهد.
صفحات مورد نظر برای استخراج را انتخاب کنید
روی کارتهای تصویر بندانگشتی صفحات منفرد کلیک کنید تا انتخاب شوند، یا شماره صفحات و بازهها (مثلاً 1-3، 5، 8-12) را در فیلد ورودی بازه وارد کنید.
انتخاب صفحات استخراجی را پیشنمایش کنید
انتخاب برجستهشده را در گالری تعاملی بررسی کنید تا تأیید شود همه فصلها، مدارک یا صفحات قرارداد لازم گنجانده شدهاند.
PDF جدید خود را تولید و دانلود کنید
روی «استخراج صفحات» کلیک کنید. موتور صفحات انتخابی شما را در یک سند PDF تازه و مستقل کامپایل و پیوند دانلود فوری را ارائه میدهد.
در گردشکارهای اسناد سازمانی، اغلب فقط به بخش کوچکی از یک سند PDF عظیم نیاز دارید. یک گزارش سالانه ۲۰۰ صفحهای شرکت خلاصه مدیریتی ۲ صفحهای دارد که برای یک ارائه لازم دارید؛ یک قرارداد اجاره تجاری ۵۰ صفحهای پیوست ۳ صفحهای نقشه طبقه دارد که پیمانکار درخواست کرده؛ یا یک پرونده پزشکی اسکنشده یک گزارش آزمایشگاهی منفرد دارد که ارزیاب بیمه به آن نیاز دارد. ارسال کل سند یکپارچه پهنای باند را هدر میدهد، گیرندگان را آزرده میکند و اطلاعات محرمانه نامرتبط را افشا میکند.
ابزار «استخراج صفحات انتخابی» ما که در مرورگر اجرا میشود، به شما امکان میدهد صفحات مشخصی را جدا و در یک سند PDF کاملاً جدید و مستقل مستقیماً در مرورگر ذخیره کنید. صفحات را بهصورت بصری با تصاویر بندانگشتی پروضوح انتخاب کنید یا شماره صفحات و بازههای سفارشی (مثلاً `1-3, 5, 8-12`) را وارد کنید. موتور ما با پیمایش گراف وابستگی، کپی بدون اتلاف جریانها و هرس منابع بدون ارجاع، در چند ثانیه یک سند PDF تمیز و سبک تولید میکند. چون ۱۰۰٪ بهصورت محلی در مرورگر شما از طریق WebAssembly و PDF-Lib کار میکند، قراردادهای حقوقی، حسابرسیهای مالی و پروندههای پزشکی خصوصی شما بدون هیچ آپلودی به سرور کاملاً محرمانه میمانند.
خواندن راهنمای فنی کامل
معماری استخراج صفحه: جداسازی زیرگرافها
استخراج صفحات از یک PDF از نظر مفهومی عکس حذف صفحه است، اما از نظر فنی بسیار پیچیدهتر. در استاندارد PDF ISO 32000، صفحات اشیای غیرمستقیمی هستند که به منابع مشترک بیرونی اشاره میکنند: فونتها (`/Font`)، تصاویر رستری (`/XObject`)، وضعیتهای گرافیکی توسعهیافته (`/ExtGState`) و جریانهای محتوا (`/Contents`).
برای استخراج یک گزیده تمیز ۳ صفحهای از یک فایل اصلی ۲۰۰ صفحهای، موتور نمیتواند صرفاً اشیای واژهنامه صفحه را کپی کند؛ باید گراف وابستگی سند را پیمایش کند. هر اشارهگر منبع را ردیابی میکند، فقط فونتها و تصاویر لازم را در یک ظرف PDF تازه راهاندازیشده کپی میکند، شناسههای اشیا را دوباره نگاشت میکند و یک Document Catalog تازه میسازد. اگر سادهلوحانه انجام شود، فایل استخراجشده یا فونت ندارد (و متن ناپدید میشود) یا کل درخت اشیای ۱۰۰ مگابایتی سند اصلی را با خود حمل میکند. موتور ما استخراج زیرگراف تمیز و ایزوله را اجرا میکند.
استخراج صفحات غیرمتوالی و بازههای پیچیده
وظایف استخراج در دنیای واقعی بهندرت شامل بلوکهای متوالی سادهاند. در عمل حقوقی و تجاری، اغلب باید صفحات پراکنده و غیرمتوالی را با هم بستهبندی کنید: صفحه جلد، خلاصه مدیریتی، جدول هزینهها و بخش امضا.
ابزار ما از نحو استخراج انعطافپذیر پشتیبانی میکند: • انتخابهای غیرمتوالی: `1, 4, 7, 12` را وارد کنید تا صفحات منفرد مشخصی برداشته شوند. • ترکیبهای بازه ترکیبی: `1-3, 8, 15-20` را وارد کنید تا هم فصلهای متوالی و هم صفحات پیوست مستقل استخراج شوند. • انتخاب روی شبکه بصری: روی کارتهای تصویر بندانگشتی منفرد در گالری کلیک کنید تا استخراج روشن یا خاموش شود، با نشانهای بصری بیدرنگ که صفحات انتخابی را برجسته میکنند.
کاهش چشمگیر حجم فایل: هرس بیش از ۹۰٪ وزن سند
هنگام استخراج صفحات از اسناد اسکنشده سنگین یا بروشورهای بازاریابی پرگرافیک، سند استخراجشده باید بهطور چشمگیری سبکتر از فایل اصلی باشد.
موتور ما با حذف داراییهای بدون ارجاع به صرفهجویی بایتی عظیمی دست مییابد. اگر صفحات ۱ تا ۱۰ یک سند ۱۰۰ صفحهای استخراج شوند، همه تصاویر پروضوح، جدولهای فونت و طراحیهای وکتوری متعلق به صفحات ۱۱ تا ۱۰۰ کاملاً از فایل جدید حذف میشوند. یک PDF اصلی ۶۰ مگابایتی بهطور معمول یک سند ۳ صفحهای استخراجشده با وزن کمتر از ۵۰۰ کیلوبایت به دست میدهد که برای تحویل ایمیلی بیدردسر و مشاهده موبایل عالی است.
حفظ تیزی متن وکتوری، فیلدهای فرم و پیوندها
یکی از شکستهای بزرگ استخراجکنندههای آنلاین خام PDF این است که صفحات استخراجشده را به تصاویر بیتمپ رندر میکنند و متن قابل انتخاب و ویژگیهای تعاملی را برای همیشه نابود میکنند.
ابزار ما استخراج وکتوری ۱۰۰٪ بدون اتلاف انجام میدهد. زیرمجموعههای فونت TrueType، رشتههای متنی قابل انتخاب، خطوط وکتوری، تصاویر جاسازیشده پروضوح و پیوندهای وب قابل کلیک با دقت ریاضی کامل حفظ میشوند. گیرندگان میتوانند دقیقاً مانند سند اصلی متن را هایلایت کنند، پاراگرافها را کپی کنند و کلیدواژهها را با `Ctrl+F` جستوجو کنند.
حفظ چرخش صفحات منفرد و کادرهای مرزی
اسناد اغلب هندسه صفحه ترکیبی دارند: صفحات متنی عمودی همراه با نقشههای معماری افقی، صفحهگستردههای مالی یا مدارک حقوقی. هر صفحه کادرهای مرزی (`/MediaBox`، `/CropBox`) و تنظیمات چرخش (`/Rotate`) خود را حفظ میکند.
خط لوله استخراج ما این ویژگیها را با وفاداری مطلق بازتاب میدهد. صفحات افقی استخراجشده افقی میمانند؛ صفحات عمودی عمودی میمانند. هنگام باز شدن در هر نمایشگر استاندارد (مانند Adobe Acrobat یا Apple Preview)، صفحات با جهت بصری و حاشیههای مورد نظر نمایش داده میشوند.
کاربردهای سازمانی: مدارک حقوقی، درخواستهای وام و پروندههای پزشکی
جداسازی صفحات یک نیاز روزانه ضروری در بخشهای حرفهای تحت مقررات است: • وکالت: وکلا بندهای مشخص قرارداد، ادعاهای ثبت اختراع یا گزیدههای شهادت را استخراج میکنند تا بهعنوان مدرک رسمی به درخواستهای دادگاه پیوست کنند. • بانکداری و وام مسکن: کارشناسان وام صفحات افشای امضاشده وامگیرنده و جدولهای مالیاتی را از بستههای اختتامیه چندصدصفحهای استخراج میکنند. • کلینیکهای پزشکی: مدیران بهداشت و درمان گزارشهای آسیبشناسی یا خلاصههای جراحی مشخص را برای ارجاع به متخصص از پروندههای حجیم بیماران استخراج میکنند.
امنیت ۱۰۰٪ سمت کاربر درون مرورگر برای فایلهای ممتاز
استخراج صفحات اغلب با حساسترین بخشهای اسناد اختصاصی سروکار دارد: بخشهای امضای مدیران، شرایط مالی محرمانه و تشخیصهای پزشکی بیماران. آپلود این اسناد در پلتفرمهای ابری دوردست استخراج PDF اطلاعات محرمانه را در معرض ثبت داده توسط اشخاص ثالث قرار میدهد.
ابزار «استخراج صفحات انتخابی» ما ۱۰۰٪ بهصورت محلی درون مرورگر وب شما کار میکند. این ابزار بر پایه WebAssembly سمت کاربر و PDF-Lib ساخته شده و همه تجزیه دودویی، حل گراف وابستگی و کامپایل سند صرفاً در RAM دستگاه فیزیکی شما اجرا میشوند. هیچ صفحه یا متنی هرگز رایانه شما را ترک نمیکند و حریم خصوصی کامل و انطباق کامل با GDPR، HIPAA و سیاستهای محرمانگی سازمانی تضمین میشود.
💡بهترین شیوههای حرفهای برای استخراج صفحات
- •بازهها و ویرگولها را ترکیب کنید: با نحوی مانند `1-4, 8, 12-15` هم فصلهای متوالی و هم صفحات مستقل را بهراحتی استخراج کنید.
- •حجم فایل بهمراتب کوچکتر: استخراج فقط صفحات مورد نیاز فونتها و تصاویر بدون ارجاع را حذف میکند و فایلهای سبکی برای ایمیل میسازد.
- •حفظ کیفیت بدون اتلاف: صفحات استخراجشده ۱۰۰٪ تیزی متن وکتوری بومی، زیرمجموعههای فونت و وضوح تصاویر خود را حفظ میکنند.
- •صفحات امضا را استخراج کنید: صفحات امضاشده را از قراردادهای سازمانی ۱۰۰ صفحهای برای پروندههای اختتامیه و چکلیستهای بایگانی بهسرعت جدا کنید.
- •متن قابل جستوجو را حفظ کنید: متن قابل انتخاب و قابلیت کپیوچسباندن کاملاً کارا میمانند و جستوجوی کلیدواژه با Ctrl+F ممکن است.
- •مدارک افقی را بررسی کنید: ابزار ما پرچمهای `/Rotate` را حفظ میکند و تضمین میکند صفحهگستردههای افقی و نقشههای معماری درست باز شوند.
- •حریم خصوصی کامل سمت کاربر: با خیال راحت بدانید قراردادهای حقوقی محرمانه و پروندههای بیماران شما ۱۰۰٪ بهصورت محلی روی رایانهتان پردازش میشوند.
🛡️مشخصات فنی و استخراج گراف وابستگی
موتور استخراج صفحه درون مرورگر یک خط لوله پیشرفته کامپایل زیرگراف ISO 32000 را پیادهسازی میکند: ۱. تجزیه دودویی و نگاشت صفحات: PDF منبع از یک `ArrayBuffer` درون حافظه تجزیه میشود. PDF-Lib جدول ارجاع متقابل را حل و درخت ریشه `/Pages` را به یک آرایه صفحات با نمایه از صفر `[0 ... N-1]` نگاشت میکند. ۲. تجزیه و اعتبارسنجی بازه: ورودیهای کاربر (مثلاً `'1-3, 5'`) به آرایهای از نمایههای صفحه مبتنی بر صفر `[0, 1, 2, 4]` تجزیه میشوند. حذف تکرار و بررسی مرزها از صفحات تکراری یا خطاهای خارج از بازه جلوگیری میکند. ۳. راهاندازی سند جدید و کپی گراف: یک نمونه تازه `PDFDocument` راهاندازی میشود. موتور `copyPages(sourceDoc, pageIndices)` را اجرا میکند. الگوریتم پیمایش وابستگی عمقاول انجام میدهد، فقط اشیای غیرمستقیمی را که از صفحات هدف قابل دسترسیاند (Content Streams، Font Descriptors، XObject Images و Annotations) کپی و شناسههای اشیا را به ترتیب دوباره شمارهگذاری میکند. ۴. ساخت کاتالوگ و درخت صفحات: صفحات کپیشده به درخت `/Pages` سند مقصد افزوده میشوند. آرایه `/Kids` پر و `/Count` برابر کل صفحات استخراجشده تنظیم میشود. ۵. سریالسازی دودویی: سند مقصد از طریق `save()` سریالسازی میشود. موتور جابهجاییهای شیء بهروزشده را در یک جدول ارجاع متقابل تازهساخته مینویسد و در چند میلیثانیه یک Blob دودویی منطبق با ISO خروجی میدهد.
فناوری: WebAssembly • Web Workers چندرشتهای • HTML5 Canvas API
حریم خصوصی: فایلها از دستگاه شما خارج نمیشوند و در فضای ابری ذخیره نمیشوند؛ آمار فقط با رضایت شما اجرا میشود.
ابزارهای مکمل این روند کار
این ابزارهای مرورگری را برای روند کاری پربازده با هم ترکیب کنید.
ادغام اسناد PDF
چندین سند PDF را در چند ثانیه در یک سند مرتب ترکیب کنید.
تقسیم PDF بر اساس صفحه
بازههای مشخصی از صفحات را جدا کنید یا صفحات را در فایلهای جداگانه استخراج کنید.
چرخش صفحات PDF
جهت عمودی و افقی صفحات PDF را ۹۰، ۱۸۰ یا ۲۷۰ درجه بچرخانید.
تغییر ترتیب صفحات PDF
با کشیدن و رها کردن تصاویر بندانگشتی، صفحات را به هر ترتیبی مرتب کنید.