Views
No views yet
Qwen3-1.7B_sft+rl_merged_model/
├── README.md # This file
├── config.json # Model configuration file
├── generation_config.json # Generation configuration file
├── tokenizer_config.json # Tokenizer configuration
├── tokenizer.json # Tokenizer file
├── vocab.json # Vocabulary file
├── merges.txt # BPE merges file
├── gsm8k_test_outputs.jsonl # Test set output results
├── gsm8k_train_outputs.jsonl # Training set output results
├── evaluate_accuracy.py # Accuracy evaluation script
├── collect_model_outputs.py # Model output collection script
└── utils.py # Utility functions1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_path = "./Qwen3-1.7B_sft+rl_merged_model"
4model = AutoModelForCausalLM.from_pretrained(
5 model_path,
6 trust_remote_code=True,
7 torch_dtype=torch.bfloat16,
8)
9tokenizer = AutoTokenizer.from_pretrained(
10 model_path,
11 trust_remote_code=True
12)1python evaluate_accuracy.py \
2 --file gsm8k_test_outputs.jsonl \
3 --name "Qwen3-1.7B SFT+RL"gsm8k_train_outputs.jsonl../train_sft_distillation.py (SFT), ../../train_grpo_gsm8k.py (RL)../merge_lora_model.py../README.mdgsm8k_test_outputs.jsonl, containing detailed reasoning processes for each sample