Don't Miss
保育古書|「古籍拯救隊」10年功力灌AI
By 信報財經新聞 on September 2, 2026
原文刊於信報財經新聞「CEO AI⎹ EJ Tech」
巴基斯坦民間項目伊布泰達數碼圖書館(Ibteda Digital Library)近日公布,成功把過去10年累積的人手修整書頁成果,轉為機器學習材料,透過半自動化方式處理照片,以減輕逐頁裁切及修圖負擔。
該項目於2015年發起,3位核心成員有感許多烏爾都文珍本,散落在各所大學或私人收藏,一般讀者難以取得,故決定自行索購作公開保存,惟團隊沒有專業掃描器,只能使用相機拍攝,再用Photoshop軟件裁切、拉正。
裁相拉正經驗轉為訓練資料
官方資料顯示,項目已收藏逾5000冊文書,累計82.2萬張雙頁照片,其中1765冊、逾57.5萬單頁完成後製工作,牽涉長達一萬小時以上的人手處理時間。無奈因財務、個人及情緒壓力,項目已於今年4月停止日常運作,留下至少52.6萬張原始雙頁照片未完成處理。
隨後,項目成員改變思路,把過往的Photoshop軟件與原始照片重新配對,還原當年人手選定的裁切四角、旋轉角度和留白操作,獲得3萬多組標註訓練資料,可以教導人工智能(AI)模型學習如何裁切、修整頁面。
團隊還整理多項實作建議給同行,包括保留原圖與完成頁、驗證兩者配對正確、統計不同書種的標註接受率、校正整冊一致偏差、容許修圖模型放棄修改,以及在輸出結果附記檔案的雜湊值(hash)及處理紀錄。
目前團隊已將約1300本數碼化典籍,上傳到互聯網檔案館(Internet Archive)供人瀏覽,但尚未決定是否公開程式碼與模型權重,只表示歡迎各方檔案館、圖書館及研究人員聯絡洽談合作。
支持EJ Tech
如欲投稿、報料,發布新聞稿或採訪通知,按這裏聯絡我們。




















