Views
No views yet
Built with Llama
meta-llama/Llama-3.2-11B-Vision-Instruct 為基底,由云碩科技在自有 AI 算力資源池上微調的繁體中文(台灣)OCR 模型。專注台灣場景的文字辨識——公文、票據、機房與售前筆記等中英混寫內容,可地端部署、資料不外流。xReadable:讓文件被讀懂。定位:印刷/掃描文件辨識已達可用水準;手寫辨識為實驗性預覽(experimental preview),持續迭代中。
| 場景 | CER | 說明 |
|---|---|---|
| 印刷/掃描繁中文件(真實照片 120 張) | 0.93% | 可用水準 |
| 手寫繁中筆記(真實照片,短篇業務筆記) | 64.1%(4 張) | experimental preview,尚未達生產可用 |
| 手寫繁中筆記(長篇多句內容) | 142.2%(16 張) | experimental preview,長文本仍會出現內容幻覺 |
mllama 架構,llama.cpp 官方目前不支援轉換或載入(上游 issue 自 2024-09 未解決)。這代表 llama.cpp / llama-server / LM Studio / GPT4All 等以 llama.cpp 為底層的工具目前都無法運行本模型(市面上少數自稱支援的 mllama GGUF 是用 Ollama 私有 fork 轉出,僅能在該環境下運作,與標準 llama.cpp 生態不相容)。上游一旦支援,本 repo 會補上官方相容的 GGUF 版本。transformers(Python)與 vLLM 皆原生支援 mllama 架構,可直接載入本模型。device_map="auto" 搭配多卡分攤,或自行做 int8/int4 量化(bitsandbytes)降低需求。1from transformers import MllamaForConditionalGeneration, AutoProcessor
2from PIL import Image
3import torch
4
5model_id = "xCloudinfo/Llama-xReadable-11B-zhTW-OCR-v1"
6model = MllamaForConditionalGeneration.from_pretrained(
7 model_id, torch_dtype=torch.bfloat16, device_map="auto"
8).eval()
9processor = AutoProcessor.from_pretrained(model_id)
10
11image = Image.open("your_document.jpg").convert("RGB")
12prompt = "請辨識圖片中的所有文字,逐字完整輸出,只輸出文字本身。"
13messages = [{"role": "user", "content": [{"type": "image"}, {"type": "text", "text": prompt}]}]
14text = processor.apply_chat_template(messages, add_generation_prompt=True, tokenize=False)
15inputs = processor(text=[text], images=[image], return_tensors="pt").to(model.device)
16out = model.generate(**inputs, max_new_tokens=768, do_sample=False)
17print(processor.decode(out[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))1vllm serve xCloudinfo/Llama-xReadable-11B-zhTW-OCR-v1 \
2 --dtype bfloat16 \
3 --max-model-len 4096image_url 傳入 messages)呼叫即可。meta-llama/Llama-3.2-11B-Vision-Instruct(Meta Platforms, Inc.)。Llama 3.2 為 Meta 之財產,Llama Materials 之權利與所有權屬 Meta。Llama-xReadable-11B-zhTW-OCR-v1)。LICENSE 檔);使用、重製、散布本模型或其衍生物,須提供該授權副本並保留本聲明。