Views
No views yet
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "ivmelabs/Ivme-Conversate-N-v2-Instruct", trust_remote_code=True
5)
6tok = AutoTokenizer.from_pretrained("ivmelabs/Ivme-Conversate-N-v2-Instruct")
7
8ids = tok("Hello!", return_tensors="pt").input_ids
9out = model.generate(ids, max_new_tokens=80, do_sample=True, temperature=0.8, top_k=40)
10print(tok.decode(out[0])).generate() works but is O(n^2)
rather than O(n), fine for short samples, not tuned for long-form serving.