Views
No views yet
Built with Llama
meta-llama/Llama-3.2-11B-Vision-Instruct 為基底,由云碩科技在自有 AI 算力資源池上微調的繁體中文(台灣)OCR 模型。專注台灣場景的文字辨識——公文、票據、文件與各類筆記的中英混寫內容,可地端部署、資料不外流。xReadable:讓文件被讀懂。v3 相對 v2 的變化:合成語料的字型多樣性由 5 個設計家族擴充到 16 個家族/36 個字型檔(另保留 8 家族/17 字型檔全程不進訓練,專供泛化量測)。印刷辨識在四項量測上全面優於 v2。
| 量測 | v3(本模型) | v2(前版) | nemotron-ocr-v2(NVIDIA,外部對照) |
|---|---|---|---|
| 未見字型·宋體(macOS Songti TC) | 0.00% | 0.00% | 2.78% |
| 未見字型·黑體(macOS STHeiti) | 1.39% | 2.78% | 9.72% |
| 保留字型集(8 家族,200 張) | 7.28% | 7.80% | — |
| 訓練字型集(200 張,參考值) | 0.28% | 0.44% | — |
nvidia/nemotron-ocr-v2 為偵測+辨識管線(非語言模型),在相同影像、相同 CER 計算下量測。| 場景 | CER | 說明 |
|---|---|---|
| 清晰短篇 | 約 40% | 實驗性,需人工複核 |
| 長篇多句內容 | 73.5% | v2 起已大幅改善(v1 為 142%) |
| 潦草/淡筆 | 64~88% | 見下方說明 |
nemotron-ocr-v2,偵測+辨識管線)在同一組真實手寫影像上交叉驗證,逐張 CER 與本模型幾乎一致(某淡鉛筆掃描頁兩者皆約 88%、某清晰頁皆約 45%)。兩種原理迥異的系統得到相同的逐張結果,代表該數字主要由影像本身的可辨識度決定,而非單一模型的弱點。量測方法提醒:自行評測時,請先確認測試影像的字型確實含有待測字元。部分字型檔(如 macOSSongti.ttc的第 0 個字面為簡體字面)缺繁體字時,PIL 等渲染器會靜默畫成空白而非豆腐字,導致模型被錯誤扣分。建議渲染後逐字驗證非空白再用於評測。
mllama 架構 llama.cpp 官方尚未支援轉換/載入,故 llama.cpp/LM Studio/Ollama 目前無法運行本模型;transformers 與 vLLM 可原生載入。上游支援後將補上官方相容 GGUF。device_map="auto" 多卡分攤;記憶體不足可用 bitsandbytes 做 int8/int4 量化。1from transformers import MllamaForConditionalGeneration, AutoProcessor
2from PIL import Image
3import torch
4
5model_id = "xCloudinfo/Llama-xReadable-11B-zhTW-OCR-v3"
6model = MllamaForConditionalGeneration.from_pretrained(
7 model_id, torch_dtype=torch.bfloat16, device_map="auto"
8).eval()
9processor = AutoProcessor.from_pretrained(model_id)
10
11image = Image.open("your_document.jpg").convert("RGB")
12prompt = "請辨識圖片中的所有文字,逐字完整輸出,只輸出文字本身。"
13messages = [{"role": "user", "content": [{"type": "image"}, {"type": "text", "text": prompt}]}]
14text = processor.apply_chat_template(messages, add_generation_prompt=True, tokenize=False)
15inputs = processor(text=[text], images=[image], return_tensors="pt").to(model.device)
16out = model.generate(**inputs, max_new_tokens=768, do_sample=False)
17print(processor.decode(out[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))vllm serve xCloudinfo/Llama-xReadable-11B-zhTW-OCR-v3 --dtype bfloat16 --max-model-len 4096meta-llama/Llama-3.2-11B-Vision-Instruct(Meta Platforms, Inc.)。LICENSE);須提供該授權副本並保留本聲明。