Views
No views yet
Asia/Seoul 시간대의 메모리 Calendar 환경을 대상으로 합니다.
학습 데이터는 NotoriousH2/calendar-agent-benchmark revision 0eab7124771d15af17766b67e2bf6fdf14ca8d27를 사용했습니다.1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model_id = "NotoriousH2/Qwen3-4B-Calendar-Agent-SFT"
4tokenizer = AutoTokenizer.from_pretrained(model_id)
5model = AutoModelForCausalLM.from_pretrained(model_id, device_map="auto")adapter/에 있습니다.
학습 설정은 training_config.json, 전체 학습 기록은 history.json에서 확인할 수 있습니다.checkpoint-60(학습 step 60)을 포함합니다.
선택 근거: 60 step으로 설정한 SFT 학습의 최종 체크포인트
데이터 해시, dev 지표, 모델 해시는 selected_checkpoint.json에 있습니다.
공개 dev 원시 결과와 선택 summary는 각각 selection/dev_evaluation.json과 selection/dev_selection_summary.json에 있습니다.
dev 평가는 서버 시드 42와 VLLM_BATCH_INVARIANT=1을 사용합니다.| 모델 | Valid Tool Call | Policy Compliance | Task Success | Average Tool Calls |
|---|---|---|---|---|
| Base | 100.00% | 80.00% | 20.00% | 0.80 |
| SFT | 100.00% | 89.25% | 89.00% | 2.55 |
base_evaluation.json과 sft_evaluation.json에 있습니다.