Views
No views yet
transformers library using pipeline abstraction as follows:1import torch
2from transformers import pipeline
3
4model_id = "Orange/Wolof-Qwen3-8B-it-v2-fc-v2-conv-v1"
5pipe = pipeline(
6 "text-generation",
7 model=model_id,
8 torch_dtype=torch.bfloat16,
9 device_map="auto",
10)
11messages = [
12 {"role": "system", "content": "You are chatbot specialized on Wolof language."},
13 {"role": "user", "content": "Can you give a sample of your specialized knowledge?"},
14]
15outputs = pipe(
16 messages,
17 max_new_tokens=256,
18)
19print(outputs[0]["generated_text"][-1])0.2.6t5alpha in the registry and the following configuration file:1data:
2 add_dataset_name: false
3 dataset_name:
4 train:
5 - path: wolof-lm/en_function_calling-instructions
6 revision: v10
7 split: train
8 - path: wolof-lm/alpaca_translated_into_wolof-instructions
9 revision: 2025.02.28
10 split: train
11 - path: wolof-lm/argilla_databricks-dolly-15k-curated-multilingual_en_translated_into_wolof-instructions
12 revision: 2025.02.28
13 split: train
14 - path: wolof-lm/samsung_samsum_instruct_dialogues_translated_in_wolof-instructions
15 revision: 2025.02.28
16 split: train
17 - path: wolof-lm/alwaly_french_wolof-instructions
18 split: train
19 - path: wolof-lm/alwaly_wolof_to_french-instructions
20 split: train
21 - path: wolof-lm/claire_masking_multilogue-instructions
22 split: train
23 - path: wolof-lm/huggingfaceh4_helpful-anthropic-raw_train_translated_in_wolof-instructions
24 split: train
25 - path: wolof-lm/lodrick-the-lafted-hermes-217k-instructions
26 split: train
27 - path: wolof-lm/wisenut-nlp-team_translated_in_wolof-instructions
28 split: train
29 - path: wolof-lm/claire_one_to_one_dialogue-instructions
30 revision: 2026.01.16
31 split: train
32 - path: wolof-lm/wol-sonatel-2025-conversations
33 revision: 2026.02.18
34 split: train
35 validation_conversational_eng:
36 - path: wolof-lm/oasst1-en-instructions
37 revision: 2026.03.19
38 split: validation
39 validation_conversational_fra:
40 - path: wolof-lm/oasst1-fr-instructions
41 revision: 2026.03.19
42 split: validation
43 - path: wolof-lm/synthetic-fr-instructions
44 revision: 2026.03.19
45 split: validation
46 validation_conversational_wol:
47 - path: wolof-lm/claire_one_to_one_dialogue-instructions
48 revision: 2026.01.16
49 split: validation
50 - path: wolof-lm/wol-sonatel-2025-conversations
51 revision: 2026.02.18
52 split: validation
53 validation_fc:
54 - path: wolof-lm/en_function_calling-instructions
55 revision: v10
56 split: validation
57 validation_if:
58 - path: wolof-lm/tulu-3-sft-personas-instruction-following
59 split: validation
60 validation_it-v2:
61 - path: wolof-lm/alpaca_translated_into_wolof-instructions
62 revision: 2025.02.28
63 split: validation
64 - path: wolof-lm/argilla_databricks-dolly-15k-curated-multilingual_en_translated_into_wolof-instructions
65 revision: 2026.03.02
66 split: validation
67 - path: wolof-lm/samsung_samsum_instruct_dialogues_translated_in_wolof-instructions
68 revision: 2025.02.28
69 split: validation
70 - path: wolof-lm/alwaly_french_wolof-instructions
71 split: validation
72 - path: wolof-lm/alwaly_wolof_to_french-instructions
73 split: validation
74 - path: wolof-lm/claire_masking_multilogue-instructions
75 split: validation
76 - path: wolof-lm/huggingfaceh4_helpful-anthropic-raw_train_translated_in_wolof-instructions
77 split: validation
78 - path: wolof-lm/lodrick-the-lafted-hermes-217k-instructions
79 split: validation
80 - path: wolof-lm/wisenut-nlp-team_translated_in_wolof-instructions
81 split: validation
82 debug: false
83 implementation_name: conversations
84description:
85 contributors:
86 - email: claire.perroux@orange.com
87 first_name: Claire
88 last_name: Perroux
89 - email: pierre.adam@orange.com
90 first_name: Pierre
91 last_name: Adam
92 domain: Wolof
93 languages:
94 - wo
95 model_name: Orange/Wolof-Qwen3-8B-it-v2-fc-v2-conv-v1
96image:
97 name: registry.gitlab.tech.orange/nepal/knowledge/orangelm/lm-adaptation/lm-adaptation
98 version: 0.2.6t5alpha
99model:
100 attn_implementation: flash_attention_2
101 chat_template_tokenizer: Orange/Qwen3-8B
102 model_name_or_path: Orange/Qwen3-8B
103 trust_remote_code: true
104software_info:
105 git:
106 branch: 119-cuda-13-and-transformers-5
107 commit_date: '2026-06-10 15:41:20+02:00'
108 commit_hash: 314a8efb580bf36117958e80dc33d7e221aa7d30
109 commit_message: 'build: set same version for kernels library in pyproject
110 as in requirements.txt'
111 is_dirty: false
112 short_hash: 314a8ef
113 parameters:
114 accelerate_file: null
115 clean_output: false
116 cluster: marcel
117 codecarbon_log_level: warning
118 collator_stats: false
119 config_file: resources/configs/Wolof-Qwen3-8B-it-v2-fc-v2-conv-v1.yml
120 constraints: queue:name=gpu_mem_80,gpu:2,partition:name=multigpu,partition:name=All
121 data_seed: 42
122 debug: false
123 deepspeed_file: resources/deepspeed/zero3.json
124 dry_run: false
125 environment_variable:
126 TOKENIZERS_PARALLELISM: 'false'
127 load_only: null
128 log_level: INFO
129 log_output: null
130 merge_peft: false
131 no_requeue: false
132 output_dir: Wolof-Qwen3-8B-it-v2-fc-v2-conv-v1-t5-torch28-2gpu
133 profiler_config: null
134 push_to_hub: false
135 qat_config: null
136 requeue_n_epochs: 1
137 time_out: 72h
138 time_requeue: false
139 use_qat: false
140 version: 0.21.2.dev33+gb8ccade7f.d20260610
141training:
142 assistant_only_loss: true
143 bf16: true
144 dataloader_num_workers: 4
145 dataloader_persistent_workers: false
146 dataloader_pin_memory: false
147 dataloader_prefetch_factor: 2
148 deepspeed: /config/zero3.json
149 disable_tqdm: true
150 eval_accumulation_steps: 1
151 eval_steps: 10
152 eval_strategy: steps
153 fp16: false
154 gradient_accumulation_steps: 32
155 gradient_checkpointing: true
156 learning_rate: 2.0e-05
157 log_level: warning
158 logging_dir: /outputs/Wolof-Qwen3-8B-it-v2-fc-v2-conv-v1-t5-torch28-2gpu/logs
159 logging_steps: 1
160 lr_scheduler_type: cosine
161 max_grad_norm: 1.0
162 max_length: 2048
163 max_steps: -1
164 num_train_epochs: 3
165 optim: paged_adamw_32bit
166 output_dir: /outputs/Wolof-Qwen3-8B-it-v2-fc-v2-conv-v1-t5-torch28-2gpu
167 per_device_eval_batch_size: 16
168 per_device_train_batch_size: 16
169 push_to_hub: false
170 report_to: tensorboard
171 save_steps: 0
172 save_strategy: epoch
173 save_total_limit: 1
174 seed: 42
175 torch_compile: false
176 training_type: instruct-tuning
177 use_liger_kernel: true
178 warmup_ratio: 0.05
179 weight_decay: 0.11{
2 "fp16": {
3 "enabled": "auto",
4 "loss_scale": 0,
5 "loss_scale_window": 1000,
6 "initial_scale_power": 16,
7 "hysteresis": 2,
8 "min_loss_scale": 1
9 },
10 "bf16": {
11 "enabled": "auto"
12 },
13 "zero_optimization": {
14 "stage": 3,
15 "offload_optimizer": {
16 "device": "cpu",
17 "pin_memory": false
18 },
19 "overlap_comm": true,
20 "contiguous_gradients": true,
21 "sub_group_size": "1e9",
22 "reduce_bucket_size": "auto",
23 "stage3_prefetch_bucket_size": "auto",
24 "stage3_param_persistence_threshold": "auto",
25 "stage3_max_live_parameters": "1e9",
26 "stage3_max_reuse_distance": "1e9",
27 "stage3_gather_16bit_weights_on_model_save": true
28 },
29 "gradient_accumulation_steps": "auto",
30 "gradient_clipping": "auto",
31 "steps_per_print": 2000,
32 "train_batch_size": "auto",
33 "train_micro_batch_size_per_gpu": "auto",
34 "wall_clock_breakdown": false
35}1- path: wolof-lm/en_function_calling-instructions
2 revision: v10
3 split: train
4- path: wolof-lm/alpaca_translated_into_wolof-instructions
5 revision: 2025.02.28
6 split: train
7- path: wolof-lm/argilla_databricks-dolly-15k-curated-multilingual_en_translated_into_wolof-instructions
8 revision: 2025.02.28
9 split: train
10- path: wolof-lm/samsung_samsum_instruct_dialogues_translated_in_wolof-instructions
11 revision: 2025.02.28
12 split: train
13- path: wolof-lm/alwaly_french_wolof-instructions
14 split: train
15- path: wolof-lm/alwaly_wolof_to_french-instructions
16 split: train
17- path: wolof-lm/claire_masking_multilogue-instructions
18 split: train
19- path: wolof-lm/huggingfaceh4_helpful-anthropic-raw_train_translated_in_wolof-instructions
20 split: train
21- path: wolof-lm/lodrick-the-lafted-hermes-217k-instructions
22 split: train
23- path: wolof-lm/wisenut-nlp-team_translated_in_wolof-instructions
24 split: train
25- path: wolof-lm/claire_one_to_one_dialogue-instructions
26 revision: 2026.01.16
27 split: train
28- path: wolof-lm/wol-sonatel-2025-conversations
29 revision: 2026.02.18
30 split: trainSFTTrainer,other parameters were set as default:1assistant_only_loss: true
2bf16: true
3dataloader_num_workers: 4
4dataloader_persistent_workers: false
5dataloader_pin_memory: false
6dataloader_prefetch_factor: 2
7deepspeed: /config/zero3.json
8disable_tqdm: true
9eval_accumulation_steps: 1
10eval_steps: 10
11eval_strategy: steps
12fp16: false
13gradient_accumulation_steps: 32
14gradient_checkpointing: true
15learning_rate: 2.0e-05
16log_level: warning
17logging_dir: /outputs/Wolof-Qwen3-8B-it-v2-fc-v2-conv-v1-t5-torch28-2gpu/logs
18logging_steps: 1
19lr_scheduler_type: cosine
20max_grad_norm: 1.0
21max_length: 2048
22max_steps: -1
23num_train_epochs: 3
24optim: paged_adamw_32bit
25output_dir: /outputs/Wolof-Qwen3-8B-it-v2-fc-v2-conv-v1-t5-torch28-2gpu
26per_device_eval_batch_size: 16
27per_device_train_batch_size: 16
28push_to_hub: false
29report_to: tensorboard
30save_steps: 0
31save_strategy: epoch
32save_total_limit: 1
33seed: 42
34torch_compile: false
35use_liger_kernel: true
36warmup_ratio: 0.05
37weight_decay: 0.1



emissions.csv (emissions were computed using codecarbon)