Views
No views yet
pip install mlx-lmpython -m mlx_lm.generate --model model_kkOracle --prompt "Καλημέρα!" --temp 0.31from transformers import AutoModelForCausalLM, AutoTokenizer
2
3device = "cuda" # or "cpu"
4
5model = AutoModelForCausalLM.from_pretrained("model_kkOracle")
6tokenizer = AutoTokenizer.from_pretrained("model_kkOracle")
7
8model.to(device)
9
10messages = [
11 {"role": "user", "content": "Καλημέρα!"},
12]
13
14prompt = tokenizer.apply_chat_template(messages, add_generation_prompt=True, tokenize=False)
15input_prompt = tokenizer(prompt, return_tensors='pt').to(device)
16outputs = model.generate(input_prompt['input_ids'], max_new_tokens=256, do_sample=True, temperature=0.3, use_cache=True, pad_token_id=tokenizer.eos_token_id, attention_mask=input_prompt["attention_mask"])
17
18print(tokenizer.batch_decode(outputs)[0])