OCR PDF
Ubah PDF hasil scan/gambar jadi teks yang bisa dicari & disalin (WASM, offline).
🔍 Seret PDF scan/gambar ke sini
OCR offline via Tesseract WASM — ubah gambar jadi teks yang bisa dicari. 100% di browser.Tentang OCR PDF
OCR PDF mengenali teks pada dokumen hasil pindai lalu menyimpannya sebagai lapisan teks di dalam dokumen. Setelah diproses, isi dokumen dapat dicari, disalin, dan dibaca oleh pembaca layar, meskipun tampilannya yang terlihat tetap berupa hasil pindai.
Pengenalan dilakukan di peramban memakai mesin Tesseract berbasis WebAssembly, sehingga gambar halaman tidak dikirim ke server. Model bahasa akan diunduh sekali saat pemakaian pertama, sehingga proses awal terasa lebih lama.
Cara memakai OCR PDF
- Unggah berkas PDF hasil pindai yang akan diubah menjadi dokumen yang dapat dicari.
- Pilih bahasa dokumen. Hasil akan jauh lebih baik bila bahasa yang dipilih sesuai bahasa asli teks.
- Jalankan proses, lalu tunggu sampai seluruh halaman selesai dikenali. Dokumen banyak halaman bisa memerlukan waktu cukup lama.
- Buka hasilnya, coba cari satu kata yang Anda tahu ada di dokumen, lalu periksa beberapa bagian untuk menilai ketepatan pengenalan.
Contoh pemakaian di pekerjaan sehari-hari
Arsip surat hasil pindai
Surat lama yang hanya tersedia sebagai hasil pindai sulit dicari kembali. Setelah OCR, nomor surat atau nama pengirim dapat ditemukan dengan pencarian biasa.
Membuat dokumen dapat dibaca pembaca layar
Lapisan teks hasil OCR membuat dokumen hasil pindai dapat diakses pembaca layar, sehingga isinya dapat dikonsumsi pengguna yang mengandalkan pendengaran.
Batasan yang perlu Anda tahu
- Hasil pengenalan bisa salah baca, terutama pada huruf yang menyatu, tabel rapat, atau dokumen dengan noda. Selalu periksa bagian berisi angka penting.
- Mutu pemindaian sangat menentukan. Dokumen di bawah 300 DPI atau miring terhadap bidang pemindai menurunkan ketepatan secara nyata.
- Teks tulisan tangan umumnya tidak dikenali dengan baik; OCR dirancang untuk teks tercetak.
- Ukuran berkas bertambah karena dokumen menyimpan gambar asli sekaligus lapisan teks, dan prosesnya memerlukan memori peramban yang cukup besar.
Pertanyaan yang sering muncul tentang pdf tools
- Apakah OCR mengubah tampilan dokumen saya?
- Tidak. Gambar halaman tetap seperti semula; yang ditambahkan adalah lapisan teks tak terlihat di belakangnya, sehingga dokumen tampak sama saat dibuka.
- Mengapa hasil OCR saya banyak yang salah?
- Penyebab paling umum adalah mutu pindai yang rendah, dokumen yang miring, atau pilihan bahasa yang tidak sesuai. Pindai ulang pada 300 DPI dengan posisi tegak, lalu ulangi proses dengan bahasa yang tepat.
- Apakah dokumen saya dikirim ke internet?
- Proses pengenalan berjalan di peramban Anda. Koneksi internet tetap dipakai sekali untuk mengunduh model bahasa pada pemakaian pertama, sehingga ukuran unduhan tersebut bisa beberapa megabita.