ConvertiloConvertilo

PDF'den Metin Çıkar Online

PDF belgelerden doğrudan tarayıcınızda metin çıkarıp OCR yapın. Normal PDF ve taramalar üzerinde çalışıyor, 16 dil destekleniyor. Dosyalar asla cihazınızdan ayrılmaz.

Dosyanızı buraya sürükleyip bırakın veya seçmek için tıklayın

Dosyalar asla cihazınızdan ayrılmaz — her şey tarayıcınızda yerel olarak çalışıyor.

PDF metin çıkarma ve OCR nedir?

PDF'den metin çıkarmak, belge sayfalarını kopyalayabilen, arayabileceğiniz ve çevirebileceğiniz düzenlenebilir düz metne dönüştürmek anlamına gelir. Sadece yükle ve düğmeye bas — dil algılanması otomatik oluyor, metin katmanlı PDF'ler saniyeler içinde çıkarılır, taramalar tarayıcı içi OCR (Tesseract WASM, 16 dil) üzerinden yapılır. Dosyalar asla cihazınızdan ayrılmaz.

PDF Metin Çıkarma SSS

Taranmış PDF'lerde çalışıyor mu?

Evet. PDF'de metin katmanı yoksa, otomatik olarak tarayıcınızda OCR (tanıma) çalıştırılır. İngilizce, Rusça, Ukraynaca, Almanca, Fransızca dahil 16 dil. Adobe Acrobat veya ABBYY FineReader'a gerek yok.

PDF'im nereye gidiyor?

Hiçbir yerde. Dosya tarayıcınızda okunur, metin PDF.js üzerinden yerel olarak çıkarılır, OCR ise WebAssembly Tesseract motoru üzerinden çalışır. Ne PDF ne de tanınan metni görmüyoruz — taranmış pasaportlar, sözleşmeler, tıbbi kayıtlar için kritik.

Belge dilini seçmem gerekiyor mu?

Hayır — otomatik olarak algılanıyor. Metin katmanı olan PDF'ler dil tanımlaması için `franc` üzerinden geçer; taramalar, baskın alfabeyi (Kiril, Latince, Arapça) okumak için ilk sayfada Tesseract OSD kullanır. Desteklenen diller: İngilizce, Rusça, Ukraynaca, Almanca, Fransızca, İspanyolca, İtalyanca, Lehçe, Çekçe, Portekizce, Felemenkçe, Bulgarca, Farsça, Estonca, İzlandaca, Norveççe. Tespit edilen dilin tanıma modeli bir kez indirilir (~10–15 MB) ve tarayıcınız tarafından önbelleğe alınır.

Ne kadar hızlı?

Metin katmanlı PDF — her boyut için 1–3 saniye. Taramalar — cihazınıza bağlı olarak sayfa başına yaklaşık 5–30 saniye. Modern bir masaüstü, 20 sayfalık taramayı 2–3 dakikada işler; Bir telefon daha yavaş.

Tanıma ne kadar doğru?

Tesseract, FineReader Express'te Linux üzerinde kullanılan açık kaynaklı bir motordur. Düz çizgilerle temiz taramalarda, kelime doğruluğu %95–99'dur. Telefonda eğri, gölge veya küçük yazı tipleriyle fotoğrafları düzeltmeyi bekleyin. El yazısı tanınmaz.

Maksimum PDF boyutu nedir?

30 MB. Daha büyük dosyalar için, PDF'nizi "Split PDF" aracımızla parçalara ayırın — tüm işlemler yereldir, dosyalar asla cihazınızdan ayrılmaz.