🔎

PDF 文字識別

識別掃描版 PDF 中的文字,輸出可編輯文字
識別 📂 辦公 👤 ToolWorld 🏷️ v1.2.2
載入中...
選擇檔案 本地讀取,不上傳伺服器
點擊選擇檔案 或拖曳到此處,檔案僅在本地處理
處理設定 調好參數再開始

識別較慢屬正常,頁數多請耐心等待

新增檔案後點「開始處理」,全程在瀏覽器本地完成,檔案不會上傳

處理結果 生成後可立即下載

使用說明

📖 工具介紹


給掃描版 PDF 做文字識別的工具。上傳後選好語言,逐頁識別,出來的文字直接可以複製和編輯。

它和「PDF 轉文字」是兩回事,適用對象完全不同:轉文字讀的是 PDF 自帶的文字層,對掃描件無效;這個工具是把每一頁先渲染成圖片,再交給識別引擎去認字,所以專治掃描件、拍照文檔、截圖轉成的 PDF。判斷用哪個很簡單——原檔案裡的文字能用滑鼠選中,就用轉文字;選不中,就用這個。

識別引擎完全在你這臺設備上運行,不需要把檔案傳到任何伺服器,這也是它比在線識別慢的原因:所有計算都靠你自己的 CPU。一頁通常要幾秒到十幾秒,頁數多請耐心等,進度條會顯示當前到第幾頁和識別百分比,中途可以點停止,已經識別完的頁會保留下來。

語言支援簡體中文、英文和兩者混合。渲染倍率決定識別前把頁面放大多少,1.5 倍是大多數情況的平衡點,字特別小或者原圖模糊時可以提到 2 倍換取更高準確率,代價是更慢。中文與英文識別模型隨插件一起提供,不需要聯網下載,裝好即可離線使用。

中文模型本身包含拉丁字母與數字的字形,所以選「中英混排」時用中文模型也能認出裡面的英文單詞和數字,只是專有名詞的準確率會比純英文模型略低。如果文檔基本是英文,直接選英文更快也更準。反過來以中文爲主的文檔選中文模型,不要因爲混了幾個英文單詞就切成英文模型。

✨ 功能特點


  • 專治掃描件,先渲染再識別,填補轉文字工具的空白
  • 識別引擎完全本地運行,檔案不上傳伺服器
  • 支援簡體中文、英文與中英混合三種語言
  • 渲染倍率可調,模糊或小字文檔可提倍率換準確率
  • 實時顯示識別進度,可中途停止且已識別頁保留
  • 結果可一鍵複製,也可下載爲 txt 檔案

🚀 使用方式


  1. 點上傳區域選擇一個掃描版 PDF,或把檔案拖進來
  2. 選擇識別語言,中英混排的文檔選「中英混合」
  3. 選擇渲染倍率,預設 1.5 倍即可
  4. 點「開始處理」,等待逐頁識別完成
  5. 檢查結果後點「複製文字」或「下載結果」儲存

⚠️ 注意事項


  • 識別速度慢是正常的:計算全靠本地 CPU,一頁數秒到十幾秒,頁數多請耐心等待
  • 識別結果需要人工校對:手寫體、藝術字、極低解析度的文檔準確率會明顯下降
  • 語言包已內置本地:中文與英文識別模型隨插件一起提供,無需聯網下載即可使用
  • 排版不會還原:輸出的是純文字流,表格與多欄結構需要自己整理
  • 超大檔案受記憶體限制:頁數極多時耗時很長,建議分批識別

相關推薦

⏫︎