Views
No views yet

[!WARNING] While the base versions of our LLäMmlein are quite good, our chat versions are research demonstrations and are not ready to be used in settings where close instruction following is necessary. Please check the paper for more details.
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained("LSX-UniWue/LLaMmlein_7B_chat")
4tokenizer = AutoTokenizer.from_pretrained("LSX-UniWue/LLaMmlein_7B_chat")
5model = model.to("mps")
6
7messages = [
8 {
9 "role": "user",
10 "content": "Was sind die wichtigsten Sehenswürdigkeiten von Berlin?",
11 },
12]
13
14chat = tokenizer.apply_chat_template(
15 messages,
16 return_tensors="pt",
17 add_generation_prompt=True,
18).to("mps")
19
20
21print(
22 tokenizer.decode(
23 model.generate(
24 chat,
25 max_new_tokens=100,
26 pad_token_id=tokenizer.pad_token_id,
27 eos_token_id=tokenizer.eos_token_id,
28 repetition_penalty=1.1,
29 )[0],
30 skip_special_tokens=False,
31 )
32)