Views
No views yet
sahilmobopenai/gpt-oss-20bhf jobs uv run)sahilmob/wish-engine-toolcall-next-v3-general
1770, validation 245, test 222sahilmob/wish-engine-toolcall-next-v3-strict-general
732, validation 91, test 90sahilmob/wish-engine-toolcall-next-v2sahilmob/wish-engine-toolcall-next-v2-strictsahilmob/gpt-oss-20b-toolcall-phase1-v3-strict-general-lorasahilmob/gpt-oss-20b-toolcall-two-phase-v3-general-lorasahilmob/gpt-oss-20b-toolcall-phase1-v2-strict-lorasahilmob/gpt-oss-20b-toolcall-two-phase-v2-lorasahilmob/trackio| Job ID | Hardware | Status | Notes |
|---|---|---|---|
699b2e2952d1c53b7df7d2d4 | a10g-large | ERROR | CUDA OOM during model placement (torch.OutOfMemoryError) |
699b2eda52d1c53b7df7d2d6 | a10g-large | ERROR | invalid gradient ... expected device meta but got cuda:0 |
699b30551aad19adb8aacbdb | a10g-large | ERROR | CUDA OOM in accelerate.prepare |
699b310652d1c53b7df7d2d8 | a100-large | COMPLETED | successful v2 two-phase training run |
699b380b1aad19adb8aacc34 | a100-large | ERROR | early v2 eval run failed |
699b4a1b1aad19adb8aacd14 | a100-large | COMPLETED | v3 datasets baseline eval (base model) |
699b4a1a1aad19adb8aacd13 | a100-large | COMPLETED | v3 datasets baseline eval (v2 adapter) |
699b6ba31aad19adb8aacee3 | a100-large | COMPLETED | successful v3 two-phase training run |
699b735552d1c53b7df7d347 | a100-large | COMPLETED | post-train base eval on v3 datasets |
699b73601aad19adb8aacf4d | a100-large | COMPLETED | post-train tuned eval on v3 datasets |
artifacts/job-history.snapshot.json699b6ba31aad19adb8aacee3:sahilmob/wish-engine-toolcall-next-v3-strict-general, 2 epochs)
train_loss: 2.904mean_token_accuracy: 0.6004eval_loss: 2.486eval_mean_token_accuracy: 0.5683sahilmob/wish-engine-toolcall-next-v3-general, 1 epoch)
train_loss: 1.924mean_token_accuracy: 0.6225eval_loss: 1.801eval_mean_token_accuracy: 0.6285tuned - base):mean_masked_nll: 4.3395 -> 0.5443 (-3.7952, lower is better)masked_perplexity: 76.6717 -> 1.7235 (-74.9483, lower is better)tool_name_exact_accuracy: 0.0619 -> 0.0000 (-0.0619)tool_name_canonical_exact_accuracy: 0.0667 -> 0.3762 (+0.3095)tool_name_contains_expected_accuracy: 0.0810 -> 0.3762 (+0.2952)tool_name_canonical_contains_expected_accuracy: 0.0810 -> 0.3762 (+0.2952)tool_name_parsed_ratio: 0.2619 -> 0.9810 (+0.7190)v3 tuned - v2 tuned):mean_masked_nll: +0.0031 (slightly worse)masked_perplexity: +0.0053 (slightly worse)tool_name_canonical_exact_accuracy: +0.0048 (slightly better)tool_name_canonical_contains_expected_accuracy: +0.0048 (slightly better)tool_name_parsed_ratio: -0.0190 (slightly worse)runtime.strict_chat_template=true
runtime.skip_trainer_model_move=true
runtime.force_single_device_model=true
artifacts/two-phase-toolcall.hf.config.jsonHF_JOB_FLAVOR=a100-large HF_JOB_TIMEOUT=5h npm run ft:train:toolcalls:payload1hf jobs uv run training/hf-jobs/generated_two_phase_toolcall_train.py \
2 --flavor a100-large \
3 --secrets HF_TOKEN \
4 --timeout 5h \
5 -dhf jobs inspect 699b6ba31aad19adb8aacee31hf jobs uv run training/hf-jobs/eval_toolcall_models.py \
2 --flavor a100-large \
3 --timeout 3h \
4 --secrets HF_TOKEN \
5 -d \
6 --base-model openai/gpt-oss-20b \
7 --adapter-model sahilmob/gpt-oss-20b-toolcall-two-phase-v3-general-lora \
8 --datasets sahilmob/wish-engine-toolcall-next-v3-strict-general,sahilmob/wish-engine-toolcall-next-v3-general \
9 --max-samples-per-dataset 120 \
10 --generation-samples-per-dataset 120 \
11 --max-new-tokens 96 \
12 --max-context-tokens 2048 \
13 --eval-target tuned \
14 --seed 42artifacts/job-history.snapshot.json../eval-results/v3-general-eval-2026-02-22.json../eval-results/v3-general-eval-post-train-2026-02-22.jsongpt-oss-20b-toolcall-two-phase-v3-general-lora.