Views
No views yet
transformers library using pipeline abstraction as follows:1import torch
2from transformers import pipeline
3
4model_id = "ldp72/Test-SmolLM-Marcel-codecarbon2"
5pipe = pipeline(
6"text-generation",
7model=model_id,
8torch_dtype=torch.bfloat16,
9device_map="auto",
10)
11messages = [
12{"role": "system", "content": "You are chatbot specialized on Telco domain."},
13{"role": "user", "content": "Can you give a sample of your specialized knowledge?"},
14]
15outputs = pipe(
16messages,
17max_new_tokens=256,
18)
19print(outputs[0]["generated_text"][-1])0.1.2 in the registry and the following configuration file:1data:
2dataset_name:
3train:
4- path: telco-lm/arxiv-abstract-generation-telco-instructions
5revision: legacy
6- path: telco-lm/synthetic-dsp.stackexchange.com-multi-task-telco-instructions
7revision: legacy
8- path: telco-lm/synthetic-networkengineering.stackexchange.com-multi-task-telco-instructions
9revision: legacy
10- path: telco-lm/synthetic-security.stackexchange.com-multi-task-telco-instructions
11revision: legacy
12- path: telco-lm/synthetic-technical-3gpp-multi-task-telco-instructions
13revision: legacy
14- path: telco-lm/synthetic-technical-5gamericas-multi-task-telco-instructions
15revision: legacy
16- path: telco-lm/synthetic-technical-huawei-multi-task-telco-instructions
17revision: legacy
18- path: telco-lm/synthetic-technical-itu-multi-task-telco-instructions
19revision: legacy
20- path: telco-lm/synthetic-technical-mef-multi-task-telco-instructions
21revision: legacy
22- path: telco-lm/synthetic-technical-ngmn-multi-task-telco-instructions
23revision: legacy
24- path: telco-lm/synthetic-technical-rfc-multi-task-telco-instructions
25revision: legacy
26- path: telco-lm/teleqna-mcqa-cot-telco-instructions
27revision: legacy
28- path: telco-lm/tii-huawei-qa-open-qa-telco-instructions
29revision: legacy
30validation_abstract_generation:
31- path: telco-lm/arxiv-abstract-generation-telco-instructions
32revision: legacy
33split: validation
34validation_general:
35- path: telco-lm/slim-orca-multi-task-general-instructions
36revision: legacy
37split: validation
38validation_synthetic:
39- path: telco-lm/synthetic-dsp.stackexchange.com-multi-task-telco-instructions
40revision: legacy
41split: validation
42- path: telco-lm/synthetic-security.stackexchange.com-multi-task-telco-instructions
43revision: legacy
44split: validation
45- path: telco-lm/synthetic-networkengineering.stackexchange.com-multi-task-telco-instructions
46revision: legacy
47split: validation
48- path: telco-lm/synthetic-technical-rfc-multi-task-telco-instructions
49revision: legacy
50split: validation
51- path: telco-lm/synthetic-technical-3gpp-multi-task-telco-instructions
52revision: legacy
53split: validation
54- path: telco-lm/synthetic-technical-5gamericas-multi-task-telco-instructions
55revision: legacy
56split: validation
57- path: telco-lm/synthetic-technical-itu-multi-task-telco-instructions
58revision: legacy
59split: validation
60- path: telco-lm/synthetic-technical-mef-multi-task-telco-instructions
61revision: legacy
62split: validation
63- path: telco-lm/synthetic-technical-huawei-multi-task-telco-instructions
64revision: legacy
65split: validation
66- path: telco-lm/synthetic-technical-ngmn-multi-task-telco-instructions
67revision: legacy
68split: validation
69validation_telco_qa:
70- path: telco-lm/tii-huawei-qa-open-qa-telco-instructions
71revision: legacy
72split: validation
73validation_telco_qcm:
74- path: telco-lm/teleqna-mcqa-cot-telco-instructions
75revision: legacy
76split: validation
77debug: true
78implementation_name: instructions
79description:
80contributors:
81- email: loic.fosse@orange.com
82first_name: Loïc
83last_name: Fosse
84- email: lionel.delphinpoulat@orange.com
85first_name: Lionel
86last_name: Delphin-Poulat
87- email: ismael.rousseau@orange.com
88first_name: Ismaël
89last_name: Rousseau
90domain: Telco
91languages:
92- en
93model_name: ldp72/Test-SmolLM-Marcel-codecarbon2
94image:
95version: 0.1.2
96model:
97attn_implementation: flash_attention_2
98chat_template_tokenizer: HuggingFaceTB/SmolLM-135M-Instruct
99model_name_or_path: HuggingFaceTB/SmolLM-135M-Instruct
100trust_remote_code: true
101training:
102bf16: true
103dataloader_num_workers: 4
104dataloader_persistent_workers: true
105dataloader_pin_memory: true
106dataloader_prefetch_factor: 2
107deepspeed: /config/zero3.json
108disable_tqdm: true
109eval_accumulation_steps: 1
110eval_steps: 10
111eval_strategy: steps
112fp16: false
113gradient_accumulation_steps: 2
114gradient_checkpointing: true
115group_by_length: false
116learning_rate: 2.0e-05
117log_level: debug
118logging_dir: /outputs/Telco-SmolLM-135-Instruct-it-test-codecarbon-process-push/logs
119logging_steps: 10
120lr_scheduler_type: cosine
121max_grad_norm: 1.0
122max_steps: -1
123num_train_epochs: 2
124optim: paged_adamw_32bit
125output_dir: /outputs/Telco-SmolLM-135-Instruct-it-test-codecarbon-process-push
126per_device_eval_batch_size: 2
127per_device_train_batch_size: 2
128push_to_hub: false
129report_to: tensorboard
130save_steps: 0
131save_strategy: epoch
132save_total_limit: 1
133seed: 42
134torch_compile: false
135training_type: instruct-tuning
136use_liger_kernel: false
137warmup_ratio: 0.05
138weight_decay: 0.11{
2"fp16": {
3"enabled": "auto",
4"loss_scale": 0,
5"loss_scale_window": 1000,
6"initial_scale_power": 16,
7"hysteresis": 2,
8"min_loss_scale": 1
9},
10"bf16": {
11"enabled": "auto"
12},
13"zero_optimization": {
14"stage": 3,
15"offload_optimizer": {
16"device": "cpu",
17"pin_memory": true
18},
19"offload_param": {
20"device": "cpu",
21"pin_memory": true
22},
23"overlap_comm": true,
24"contiguous_gradients": true,
25"sub_group_size": "1e9",
26"reduce_bucket_size": "auto",
27"stage3_prefetch_bucket_size": "auto",
28"stage3_param_persistence_threshold": "auto",
29"stage3_max_live_parameters": "1e9",
30"stage3_max_reuse_distance": "1e9",
31"stage3_gather_16bit_weights_on_model_save": true
32},
33"gradient_accumulation_steps": "auto",
34"gradient_clipping": "auto",
35"steps_per_print": 2000,
36"train_batch_size": "auto",
37"train_micro_batch_size_per_gpu": "auto",
38"wall_clock_breakdown": false
39}1- path: telco-lm/arxiv-abstract-generation-telco-instructions
2revision: legacy
3- path: telco-lm/synthetic-dsp.stackexchange.com-multi-task-telco-instructions
4revision: legacy
5- path: telco-lm/synthetic-networkengineering.stackexchange.com-multi-task-telco-instructions
6revision: legacy
7- path: telco-lm/synthetic-security.stackexchange.com-multi-task-telco-instructions
8revision: legacy
9- path: telco-lm/synthetic-technical-3gpp-multi-task-telco-instructions
10revision: legacy
11- path: telco-lm/synthetic-technical-5gamericas-multi-task-telco-instructions
12revision: legacy
13- path: telco-lm/synthetic-technical-huawei-multi-task-telco-instructions
14revision: legacy
15- path: telco-lm/synthetic-technical-itu-multi-task-telco-instructions
16revision: legacy
17- path: telco-lm/synthetic-technical-mef-multi-task-telco-instructions
18revision: legacy
19- path: telco-lm/synthetic-technical-ngmn-multi-task-telco-instructions
20revision: legacy
21- path: telco-lm/synthetic-technical-rfc-multi-task-telco-instructions
22revision: legacy
23- path: telco-lm/teleqna-mcqa-cot-telco-instructions
24revision: legacy
25- path: telco-lm/tii-huawei-qa-open-qa-telco-instructions
26revision: legacySFTTrainer,other parameters were set as default:1bf16: true
2dataloader_num_workers: 4
3dataloader_persistent_workers: true
4dataloader_pin_memory: true
5dataloader_prefetch_factor: 2
6deepspeed: /config/zero3.json
7disable_tqdm: true
8eval_accumulation_steps: 1
9eval_steps: 10
10eval_strategy: steps
11fp16: false
12gradient_accumulation_steps: 2
13gradient_checkpointing: true
14group_by_length: false
15learning_rate: 2.0e-05
16log_level: debug
17logging_dir: /outputs/Telco-SmolLM-135-Instruct-it-test-codecarbon-process-push/logs
18logging_steps: 10
19lr_scheduler_type: cosine
20max_grad_norm: 1.0
21max_steps: -1
22num_train_epochs: 2
23optim: paged_adamw_32bit
24output_dir: /outputs/Telco-SmolLM-135-Instruct-it-test-codecarbon-process-push
25per_device_eval_batch_size: 2
26per_device_train_batch_size: 2
27push_to_hub: false
28report_to: tensorboard
29save_steps: 0
30save_strategy: epoch
31save_total_limit: 1
32seed: 42
33torch_compile: false
34use_liger_kernel: false
35warmup_ratio: 0.05
36weight_decay: 0.1emissions.csv (emissions were computed using codecarbon)