Views
No views yet
| Name | Quant method | Size |
|---|---|---|
| Llama3.1-ArrowSE-v0.4.Q2_K.gguf | Q2_K | 2.96GB |
| Llama3.1-ArrowSE-v0.4.IQ3_XS.gguf | IQ3_XS | 3.28GB |
| Llama3.1-ArrowSE-v0.4.IQ3_S.gguf | IQ3_S | 3.43GB |
| Llama3.1-ArrowSE-v0.4.Q3_K_S.gguf | Q3_K_S | 3.41GB |
| Llama3.1-ArrowSE-v0.4.IQ3_M.gguf | IQ3_M | 3.52GB |
| Llama3.1-ArrowSE-v0.4.Q3_K.gguf | Q3_K | 3.74GB |
| Llama3.1-ArrowSE-v0.4.Q3_K_M.gguf | Q3_K_M | 3.74GB |
| Llama3.1-ArrowSE-v0.4.Q3_K_L.gguf | Q3_K_L | 4.03GB |
| Llama3.1-ArrowSE-v0.4.IQ4_XS.gguf | IQ4_XS | 4.18GB |
| Llama3.1-ArrowSE-v0.4.Q4_0.gguf | Q4_0 | 4.34GB |
| Llama3.1-ArrowSE-v0.4.IQ4_NL.gguf | IQ4_NL | 4.38GB |
| Llama3.1-ArrowSE-v0.4.Q4_K_S.gguf | Q4_K_S | 4.37GB |
| Llama3.1-ArrowSE-v0.4.Q4_K.gguf | Q4_K | 4.58GB |
| Llama3.1-ArrowSE-v0.4.Q4_K_M.gguf | Q4_K_M | 4.58GB |
| Llama3.1-ArrowSE-v0.4.Q4_1.gguf | Q4_1 | 4.78GB |
| Llama3.1-ArrowSE-v0.4.Q5_0.gguf | Q5_0 | 5.21GB |
| Llama3.1-ArrowSE-v0.4.Q5_K_S.gguf | Q5_K_S | 5.21GB |
| Llama3.1-ArrowSE-v0.4.Q5_K.gguf | Q5_K | 5.34GB |
| Llama3.1-ArrowSE-v0.4.Q5_K_M.gguf | Q5_K_M | 5.34GB |
| Llama3.1-ArrowSE-v0.4.Q5_1.gguf | Q5_1 | 5.65GB |
| Llama3.1-ArrowSE-v0.4.Q6_K.gguf | Q6_K | 6.14GB |
| Llama3.1-ArrowSE-v0.4.Q8_0.gguf | Q8_0 | 7.95GB |
1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4DEFAULT_SYSTEM_PROMPT = "あなたは誠実で優秀な日本人のアシスタントです。特に指示が無い場合は、常に日本語で回答してください。"
5text = "Vtuberとして成功するために大切な5つのことを小学生にでもわかるように教えてください。"
6
7model_name = "DataPilot/Llama3.1-ArrowSE-v0.4"
8
9tokenizer = AutoTokenizer.from_pretrained(model_name)
10model = AutoModelForCausalLM.from_pretrained(
11 model_name,
12 torch_dtype="auto",
13 device_map="auto",
14)
15model.eval()
16
17messages = [
18 {"role": "system", "content": DEFAULT_SYSTEM_PROMPT},
19 {"role": "user", "content": text},
20]
21prompt = tokenizer.apply_chat_template(
22 messages,
23 tokenize=False,
24 add_generation_prompt=True
25)
26token_ids = tokenizer.encode(
27 prompt, add_special_tokens=False, return_tensors="pt"
28)
29
30with torch.no_grad():
31 output_ids = model.generate(
32 token_ids.to(model.device),
33 max_new_tokens=1200,
34 do_sample=True,
35 temperature=0.6,
36 top_p=0.9,
37 )
38output = tokenizer.decode(
39 output_ids.tolist()[0][token_ids.size(1):], skip_special_tokens=True
40)
41print(output)1models:
2 - model: meta-llama/Meta-Llama-3.1-8B-Instruct
3 parameters:
4 weight: 1
5 - model: elyza/Llama-3-ELYZA-JP-8B
6 parameters:
7 weight: 0.7
8 - model: nvidia/Llama3-ChatQA-1.5-8B
9 parameters:
10 weight: 0.15
11merge_method: ties
12base_model: meta-llama/Meta-Llama-3.1-8B-Instruct
13parameters:
14 normalize: false
15dtype: bfloat16