SmolLM3-3B — Spanish Reasoning Instruction Fine-Tune (Nemotron Multilingual Reasoning)
Model Description
This model is a Supervised Fine-Tuned (SFT) version of:
HuggingFaceTB/SmolLM3-3B
Fine-tuned on the Spanish (es) split of:
DGurgurov/Nemotron-Multilingual-Reasoning
The goal of this training run was to improve:
- Spanish instruction following
- multi-step reasoning
- conversational behavior
- long-context understanding
Training used structured chat conversations and completion-only loss, meaning only the assistant responses were optimized.
Key Characteristics
- Base model: SmolLM3-3B
- Language specialization: Spanish
- Context length during training: 16,384 tokens
- Chat-format training
- Packed sequences
- Long-context reasoning tuning
Intended Uses
Suitable
- Spanish conversational assistants
- tutoring or educational assistants
- reasoning and explanation tasks
- document question answering
- research on efficient small LLMs
Not Suitable
- legal or medical advice
- autonomous decision making
- safety-critical systems
- high-risk financial use
Training Data
Dataset:
DGurgurov/Nemotron-Multilingual-Reasoning
Processing configuration:
- Language filter: Spanish only
- Converted to chat messages (
prepare_messages=True)
- Assistant-only optimization (
completion_only_loss=True)
User and system messages were masked during training.
Consult the dataset card for data sources and limitations.
Training Procedure
Training was performed using HuggingFace Accelerate with Fully Sharded Data Parallel (FSDP) across 8 processes.
Core Setup
- Method: Supervised fine-tuning (SFT)
- Epochs: 3
- Maximum sequence length: 16,384 tokens
- Sequence packing: enabled
- Precision: bfloat16
- Gradient checkpointing: enabled
- Liger kernel: enabled
- Distributed training: FSDP
Optimization
- Optimizer:
adamw_torch_fused
- Batch size per device: 4
- Gradient accumulation steps: 4
- Effective batch size per GPU: 16 sequences per step
- Weight decay: 0.05
Learning rate schedule:
- Scheduler:
cosine_with_min_lr
- Warmup ratio: 0.05
- Minimum LR: 5e-6
Logging & Checkpoints
- Logging every 5 steps
- Checkpoint every 450 steps
- Weights & Biases tracking
- Token accuracy logged during training
Data Processing
- Dataset preprocessing workers: 16
- Chat formatting enabled
- Dataset preparation enabled
- Language split:
es
Usage
Transformers Example
1from transformers import AutoTokenizer, AutoModelForCausalLM
2import torch
3
4model_id = "YOUR_USERNAME/YOUR_MODEL_REPO"
5
6tokenizer = AutoTokenizer.from_pretrained(model_id, use_fast=True)
7model = AutoModelForCausalLM.from_pretrained(
8 model_id,
9 device_map="auto",
10 torch_dtype=torch.bfloat16,
11)
12
13messages = [
14 {"role": "system", "content": "Eres un asistente útil."},
15 {"role": "user", "content": "¿Por qué el cielo es azul?"}
16]
17
18prompt = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
19inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
20
21outputs = model.generate(
22 **inputs,
23 max_new_tokens=512,
24 temperature=0.7,
25 top_p=0.9,
26 do_sample=True,
27)
28
29print(tokenizer.decode(outputs[0], skip_special_tokens=True))
Important:
Use apply_chat_template() when prompting. The model was trained on chat-formatted conversations and performance will degrade without it.
Evaluation
During training, token accuracy was logged as a diagnostic metric.
Token accuracy:
- monitors training stability
- is not a benchmark
- does not measure reasoning ability
For meaningful evaluation, use:
- instruction-following benchmarks
- reasoning datasets
- long-context tasks
Limitations
- May hallucinate incorrect information
- Reasoning chains may contain logical errors
- Performance near 16k tokens depends heavily on prompt structure
- Smaller model → weaker world knowledge than larger LLMs
- Not suitable for safety-critical deployment
Bias & Safety
The model inherits biases from:
- the base model
- the training dataset
Recommended mitigations:
- moderation filtering
- safety-oriented system prompts
- human review for sensitive applications
License
This is a derivative model of:
HuggingFaceTB/SmolLM3-3B
The original base model license and restrictions apply, along with dataset terms.
Verify compatibility before commercial use.
Reproducibility (Training Arguments)
1accelerate launch --use_fsdp --num_processes 8 --config_file sft/my_config.yaml sft/sft_trainer.py
2
3--model_name HuggingFaceTB/SmolLM3-3B
4--tokenizer_name HuggingFaceTB/SmolLM3-3B
5--dataset_path DGurgurov/Nemotron-Multilingual-Reasoning
6--skip_prepare_dataset False
7--lang_split es
8--prepare_messages True
9--completion_only_loss True
10--max_length 16384
11--dataset_num_proc 16
12--packing True
13--use_liger_kernel True
14--bf16 True
15--log_token_accuracy True
16--optim adamw_torch_fused
17--gradient_checkpointing True
18--per_device_train_batch_size 4
19--gradient_accumulation_steps 4
20--ddp_find_unused_parameters False
21--lr_scheduler_type cosine_with_min_lr
22--lr_scheduler_kwargs {"min_lr": 5.0e-6}
23--warmup_ratio 0.05
24--weight_decay 0.05
25--report_to wandb
26--run_name smol_3b_3epochs_lns_es
27--num_train_epochs 3
28--save_strategy steps
29--logging_steps 5
30--save_steps 450
Citation
If you use this model, please cite:
HuggingFaceTB/SmolLM3-3B
DGurgurov/Nemotron-Multilingual-Reasoning
Acknowledgements
- HuggingFaceTB — SmolLM3 base model
- Nemotron Multilingual Reasoning dataset authors
- HuggingFace Accelerate and Transformers libraries