Views
No views yet
1# !pip install -U -q transformers accelerate sentencepiece bitsandbytes
2import torch
3from transformers import AutoModelForCausalLM, AutoTokenizer
4
5tokenizer = AutoTokenizer.from_pretrained(
6 "pszemraj/Yi-6B-200K-Llama-sharded", use_fast=False
7)
8model = AutoModelForCausalLM.from_pretrained(
9 "pszemraj/Yi-6B-200K-Llama-sharded", load_in_4bit=True
10)
11
12prompt = "Custom non-commercial software licenses are just so fun, aren't they? The best thing about them is"
13
14
15if torch.cuda.is_available():
16 torch.cuda.empty_cache()
17
18inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
19tokens = model.generate(
20 **inputs,
21 max_new_tokens=192,
22 temperature=0.75,
23 top_p=0.9,
24 no_repeat_ngram_size=4,
25 do_sample=True,
26 renormalize_logits=True,
27 repetition_penalty=1.05,
28)
29print(tokenizer.decode(tokens[0], skip_special_tokens=True))