Views
No views yet
1from transformers import AutoTokenizer, AutoModelForCausalLM
2from peft import PeftModel, PeftConfig
3from huggingface_hub import login
4
5# load model for CER predicting
6peft_model_id = "mariannam/llammas-CER-prediction"
7config = PeftConfig.from_pretrained(peft_model_id)
8
9# load base model
10base_model = AutoModelForCausalLM.from_pretrained(
11 config.base_model_name_or_path,
12 device_map="auto", # for CPU use device_map=None
13 torch_dtype="auto"
14)
15
16# load adapters
17model = PeftModel.from_pretrained(base_model, peft_model_id)
18
19# load tokenizer
20tokenizer = AutoTokenizer.from_pretrained(config.base_model_name_or_path)
21
22# input ocr text to get the CER for HERE
23ocr_text = "Misso wallas awati awalik telefoni-kõnc-punkt Hinol ja PiiganbiS mõlemal, Kanepi kanbu."
24
25# prompt tempelate
26prompt = f"""### Instruction:
27Kui suur protsent tähemärke sellest ajaloolisest eestikeelsest tekstist on vigane? Tagasta protsent täisarvuna.
28
29### Input:
30{ocr_text}
31
32### Response:
33"""
34
35# generate and print output
36inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
37outputs = model.generate(**inputs, max_new_tokens=3)
38print(tokenizer.decode(outputs[0], skip_special_tokens=True)[len(prompt):].strip())