Views
No views yet
Diamegs/PIT-4B-FT-202112. Fine-tuned on jdecim/pit-earnings-call-qa for question answering over US earnings-call transcripts, respecting PIT chronological discipline.Diamegs/PIT-4B-FT-202112peft
autoauto (PIT models pre-shift labels; do NOT use model mode — it causes identity collapse)pit (PIT chat template: <|user|>/<|assistant|>/<|end|>)1import torch
2from peft import PeftModel
3from transformers import AutoModelForCausalLM, AutoTokenizer
4
5base = AutoModelForCausalLM.from_pretrained(
6 "Diamegs/PIT-4B-FT-202112",
7 trust_remote_code=True,
8 torch_dtype=torch.bfloat16,
9)
10tok = AutoTokenizer.from_pretrained("Diamegs/PIT-4B-FT-202112", trust_remote_code=True)
11model = PeftModel.from_pretrained(base, "jdecim/SFT_202112-earnings-sft").to("cuda").eval()
12
13prompt = "<|user|>\nQuestion: What was Q4 net revenue?\nContext: …\n<|assistant|>\n"
14ids = tok(prompt, return_tensors="pt").to("cuda")
15out = model.generate(**ids, max_new_tokens=256, do_sample=False,
16 eos_token_id=tok.encode("<|end|>", add_special_tokens=False)[-1:])
17print(tok.decode(out[0, ids.input_ids.shape[1]:], skip_special_tokens=False))jdecim/pit-earnings-call-qa — see that page for the four QA buckets, split sizes, and PIT discipline details. This adapter was trained on the snapshot matching Diamegs/PIT-4B-FT-202112:1from datasets import load_dataset
2snapshot = "202112" # the trailing YYYYMM in the base model name
3ds = load_dataset("jdecim/pit-earnings-call-qa", snapshot, split="train")