Views
No views yet

1from vllm import LLM, SamplingParams
2
3sampling_params = SamplingParams(temperature=0.0, max_tokens=100)
4llm = LLM(model="lightblue/suzume-llama-3-8B-multilingual")
5
6messages = []
7messages.append({"role": "user", "content": "Bonjour!"})
8prompt = llm.llm_engine.tokenizer.tokenizer.apply_chat_template(conversation=messages, add_generation_prompt=True, tokenize=False)
9prompts = [prompt]
10
11outputs = llm.generate(prompts, sampling_params)
12for output in outputs:
13 prompt = output.prompt
14 generated_text = output.outputs[0].text
15 print(f"Prompt: {prompt!r}, Generated text: {generated_text!r}")| meta-llama/Meta-Llama-3-8B-Instruct | lightblue/suzume-llama-3-8B-multilingual | Nexusflow/Starling-LM-7B-beta | gpt-3.5-turbo | |
|---|---|---|---|---|
| German 🇩🇪 | NaN | 7.26 | 6.99 | 7.68 |
| French 🇫🇷 | NaN | 7.66 | 7.29 | 7.74 |
| Japanese 🇯🇵 | NaN | 6.56 | 6.22 | 7.84 |
| Russian 🇷🇺 | NaN | 8.19 | 8.28 | 7.94 |
| Chinese 🇨🇳 | NaN | 7.11 | 6.97 | 7.55 |
| English 🇺🇸 | 7.98 | 7.73 | 7.92 | 8.26 |
gpt-4-0125-preview1import pandas as pd
2from datasets import Dataset, load_dataset, concatenate_datasets
3
4### Tagengo
5gpt4_dataset = load_dataset("lightblue/tagengo-gpt4", split="train")
6gpt4_dataset = gpt4_dataset.filter(lambda x: x["response"][1] == "stop")
7####
8
9### Megagon
10megagon_df = pd.read_json(
11 "https://raw.githubusercontent.com/megagonlabs/instruction_ja/main/data/data.jsonl",
12 lines=True,
13 orient="records"
14 )
15role_map = {"user": "human", "agent": "gpt"}
16megagon_df["conversations"] = megagon_df.utterances.apply(lambda x: [{"from": role_map[y["name"]], "value": y["text"]} for y in x])
17megagon_df["language"] = "Japanese"
18megagon_df = megagon_df[["conversations", "language"]]
19megagon_dataset = Dataset.from_pandas(df)
20###
21
22### Openchat
23openchat_df = pd.read_json("https://huggingface.co/datasets/openchat/openchat_sharegpt4_dataset/resolve/main/sharegpt_gpt4.json?download=true")
24openchat_df["conversations"] = openchat_df["items"]
25openchat_dataset = Dataset.from_pandas(openchat_df)
26###
27
28
29dataset = concatenate_datasets([gpt4_dataset, megagon_dataset, openchat_dataset])
30dataset = dataset.filter(lambda x: not any([y["value"] is None for y in x["conversations"]]))
31dataset.select_columns(["conversations"]).to_json("/workspace/llm_training/axolotl/llama3-multilingual/tagengo_openchat_megagon.json")0.4.01base_model: meta-llama/Meta-Llama-3-8B-Instruct
2model_type: LlamaForCausalLM
3tokenizer_type: AutoTokenizer # PreTrainedTokenizerFast
4
5load_in_8bit: false
6load_in_4bit: false
7strict: false
8
9datasets:
10 - path: /workspace/llm_training/axolotl/llama3-multilingual/tagengo_openchat_megagon.json
11 ds_type: json # see other options below
12 type: sharegpt
13 conversation: llama-3
14dataset_prepared_path: /workspace/llm_training/axolotl/llama3-multilingual/prepared_tagengo_openchat_megagon
15val_set_size: 0.01
16output_dir: /workspace/llm_training/axolotl/llama3-multilingual/output_tagengo_openchat_megagon_8B_llama3
17
18sequence_len: 8192
19sample_packing: true
20pad_to_sequence_len: true
21
22use_wandb: true
23wandb_project: wandb_project
24wandb_entity: wandb_entity
25wandb_name: wandb_name
26
27gradient_accumulation_steps: 2
28micro_batch_size: 2
29num_epochs: 1
30optimizer: paged_adamw_8bit
31lr_scheduler: cosine
32learning_rate: 1e-5
33
34train_on_inputs: false
35group_by_length: false
36bf16: auto
37fp16:
38tf32: false
39
40gradient_checkpointing: true
41gradient_checkpointing_kwargs:
42 use_reentrant: false
43early_stopping_patience:
44resume_from_checkpoint:
45logging_steps: 1
46xformers_attention:
47flash_attention: true
48
49warmup_steps: 10
50evals_per_epoch: 5
51eval_table_size:
52saves_per_epoch: 1
53debug:
54deepspeed: /workspace/axolotl/deepspeed_configs/zero2.json
55weight_decay: 0.0
56special_tokens:
57 pad_token: <|end_of_text|>1from fastchat.conversation import Conversation
2from fastchat.conversation import register_conv_template
3from fastchat.conversation import SeparatorStyle
4
5register_conv_template(
6 Conversation(
7 name="llama-3",
8 system_template="<|begin_of_text|><|start_header_id|>system<|end_header_id|>\n\n{system_message}",
9 roles=("<|start_header_id|>user<|end_header_id|>\n", "<|start_header_id|>assistant<|end_header_id|>\n"),
10 sep_style=SeparatorStyle.ADD_NEW_LINE_SINGLE,
11 sep="<|eot_id|>",
12 stop_token_ids=[128009],
13 stop_str="<|eot_id|>",
14 )
15)| Training Loss | Epoch | Step | Validation Loss |
|---|---|---|---|
| 1.1894 | 0.0 | 1 | 1.0110 |
| 0.8493 | 0.2 | 73 | 0.7057 |
| 0.8047 | 0.4 | 146 | 0.6835 |
| 0.7644 | 0.6 | 219 | 0.6687 |
| 0.7528 | 0.8 | 292 | 0.6615 |
| 0.7794 | 1.0 | 365 | 0.6595 |
1@article{devine2024tagengo,
2 title={Tagengo: A Multilingual Chat Dataset},
3 author={Devine, Peter},
4 journal={arXiv preprint arXiv:2405.12612},
5 year={2024}
6}