Gemma-4-E4B-xReadable-zhTW-OCR-v1
云碩科技 · xCloudinfo · 系列:Google Gemma 4 · 云碩繁體中文 OCR
以
google/gemma-4-E4B-it 為基底,由云碩科技在自有 AI 算力資源池上微調的
繁體中文(台灣)OCR 模型。專注台灣場景的文字辨識——公文、票據、文件與各類筆記的中英混寫內容,可地端部署、資料不外流。
xReadable:讓文件被讀懂。(
x = xCloudinfo 品牌前綴,
Read + able = 讓文件可被讀取。)
與 Llama 版(Llama-xReadable)並存、各補一個部署場景:本模型基於 Gemma 4 Vision,可轉 GGUF,能直接跑在 llama.cpp / Ollama / LM Studio(Llama 3.2 Vision 版受 mllama 架構限制無 GGUF)。授權亦更寬鬆(Gemma Terms,無歐盟多模態限制)。微調時凍結視覺編碼器,僅以 LoRA 訓練語言側,看圖能力承襲 Gemma 4 原生視覺塔。
📦 本 repo 提供的檔案格式(safetensors 與 GGUF 同一 repo)
本 repo 同時內含兩種格式,依部署環境自行取用,無須另找 GGUF repo:
| 用途 | 需下載的檔案 | 適用 |
|---|
| transformers / vLLM | model.safetensors + 設定/tokenizer 檔 | 伺服器推論、微調、最高精度(bf16) |
| llama.cpp / Ollama / LM Studio(含看圖) | Gemma-4-E4B-xReadable-zhTW-OCR-v1-Q4_K_M.gguf(約 5GB)+ Gemma-4-E4B-xReadable-zhTW-OCR-v1-mmproj-f16.gguf(約 1GB) | 地端輕量、CPU 可跑 |
GGUF 看圖辨識必須同時載入 mmproj-f16(視覺投影器),只載主權重僅能處理純文字。量化 GGUF 精度略低於 bf16 safetensors,關鍵用途建議用 safetensors。
能力與量測
逐字元錯誤率(CER,越低越好)。評測字型與訓練字型完全不重疊——保留字型從建池起即切開,從未進入訓練。
| 量測 | 本模型(Gemma-4-E4B) | Llama-xReadable v3(參考) | nemotron-ocr-v2(NVIDIA,外部對照) |
|---|
| 未見字型·宋體(macOS Songti TC) | 0.00% | 0.00% | 2.78% |
| 未見字型·黑體(macOS STHeiti) | 0.00% | 1.39% | 9.72% |
| 保留字型集(8 家族,200 張) | 5.08% | 7.28% | — |
本模型在上述三項印刷 OCR 量測上均優於前一代 Llama 版與外部對照,且體積更小(8.0B vs 10.8B)。外部對照為
nvidia/nemotron-ocr-v2(偵測+辨識管線),相同影像、相同 CER 計算。
手寫
| 場景 | CER | 說明 |
|---|
| 清晰短篇 | 約 40% | 實驗性,需人工複核 |
| 潦草/淡筆 | 64~88% | 影像難度地板,非模型天花板(見下) |
手寫的 64~88% 主要由影像可辨識度決定:以架構完全不同的開源 OCR 交叉驗證,逐張 CER 與本系列模型幾乎一致(某淡鉛筆頁兩者皆約 88%、某清晰頁皆約 45%)。兩種原理迥異的系統得到相同的逐張結果,代表該數字由影像本身決定,而非單一模型的弱點。
字型分層
訓練字型(16 個設計家族):Noto Sans/Serif CJK、文鼎 UMing/UKai、Chiron Hei/Sung/GoRound、Zev Hei、GenKiGothic/GenKiMin/GenWanMin、cwTeX 明/楷/圓、jf-openhuninn、辰宇落雁體。
保留字型(8 家族,永不進訓練):GenRyuMin、GenSekiGothic、GenSenRounded、cwTeX 仿宋、EvilSung、LXGW 文楷、芫荽 Iansui、Cubic 11。
同一套設計的所有字重與正/斜體歸同一家族,避免同一設計同時出現在訓練與評測而高估泛化。
格式與用法
本 repo 同時提供 bf16 safetensors(transformers/vLLM)與 GGUF(llama.cpp/Ollama/LM Studio)。
transformers
1from transformers import Gemma4ForConditionalGeneration, AutoProcessor
2from PIL import Image
3import torch
4
5model_id = "xCloudinfo/Gemma-4-E4B-xReadable-zhTW-OCR-v1"
6model = Gemma4ForConditionalGeneration.from_pretrained(
7 model_id, torch_dtype=torch.bfloat16, device_map="auto").eval()
8processor = AutoProcessor.from_pretrained(model_id)
9
10image = Image.open("your_document.jpg").convert("RGB")
11prompt = "請辨識圖片中的所有文字,逐字完整輸出,只輸出文字本身。"
12messages = [{"role": "user", "content": [{"type": "image"}, {"type": "text", "text": prompt}]}]
13text = processor.apply_chat_template(messages, add_generation_prompt=True, tokenize=False)
14inputs = processor(text=[text], images=[image], return_tensors="pt").to(model.device)
15out = model.generate(**inputs, max_new_tokens=768, do_sample=False)
16print(processor.decode(out[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))
llama.cpp(含看圖,需搭配 mmproj)
1# 文字+視覺:主權重 + 視覺投影器 mmproj
2llama-server \
3 -m Gemma-4-E4B-xReadable-zhTW-OCR-v1-Q4_K_M.gguf \
4 --mmproj Gemma-4-E4B-xReadable-zhTW-OCR-v1-mmproj-f16.gguf \
5 --port 8080
Q4_K_M(約 5GB)為量化主權重;mmproj-f16(約 0.9GB)為視覺投影器,看圖辨識必須一併載入。本 repo 之 GGUF 已實測可在 llama.cpp 讀取圖片並輸出繁體中文;量化版辨識精度略低於 bf16,關鍵用途建議用 safetensors。
硬體
bf16 約 16GB;Q4_K_M GGUF 約 5GB,可於一般消費級 GPU 或純 CPU 執行。
用途與限制
- 適用:台灣繁中印刷/掃描文件的地端 OCR、文件數位化、票據與筆記辨識前處理。
- 輸出正規化:本模型輸出統一為繁體中文(訓練標註採繁體正規化)。
- 限制:手寫辨識仍在迭代,潦草、淡筆、低對比字跡可能出錯,重要用途請務必人工複核;表格/複雜版面建議先切行/切格;輸出僅供辨識參考,不宜作為法律、醫療、財務等關鍵決策之唯一依據。
授權與來源聲明(Gemma Terms of Use)
- 基底模型:
google/gemma-4-E4B-it(Google)。
- 散布本模型須隨附 Gemma Terms 通知,並使下游接收者同樣受其約束。
- 使用不得違反 Gemma Prohibited Use Policy。
- 微調與散布由 云碩科技 xCloudinfo 進行;不得用於非法用途;須遵守中華民國相關法律。
資料工程
訓練語料由云碩自有資料產線產生:自動化抓取權威/公開來源 → 去識別化 → 雙層品質閘門過濾 → 合成影像渲染(開放授權字型,SIL OFL 1.1/jf 開放授權等,僅用於產生影像,本 repo 不散布字型檔)。全流程於自有 AI 算力資源池執行。
由 云碩科技 xCloudinfo 於自有 AI 算力資源池微調、散布;基底模型之權利屬 Google。Gemma is provided under and subject to the Gemma Terms of Use.