Views
No views yet

bigatuna/Qwen3.5-9b-Sushi-Coderbigatuna/Qwen3.5-9b-Sushi-Coder-RLvllm-project/vllm PR #36395, fix(lora): add bounds checking for TP configurations, to address the LoRA tensor-parallel bounds issue.Qwen3.5-9b-Sushi-Coder-RL.Q4_K_M.ggufQwen3.5-9b-Sushi-Coder-RL.Q8_0.ggufQwen3.5-9b-Sushi-Coder-RL.BF16-mmproj.ggufBF16-mmproj file.1hf download bigatuna/Qwen3.5-9b-Sushi-Coder-RL-GGUF \
2 Qwen3.5-9b-Sushi-Coder-RL.Q4_K_M.gguf \
3 Qwen3.5-9b-Sushi-Coder-RL.BF16-mmproj.gguf1hf download bigatuna/Qwen3.5-9b-Sushi-Coder-RL-GGUF \
2 Qwen3.5-9b-Sushi-Coder-RL.Q8_0.gguf \
3 Qwen3.5-9b-Sushi-Coder-RL.BF16-mmproj.ggufllama.cpp, qwen3_5, multimodal, code, rl, conversationalbigatuna/Qwen3.5-9b-Sushi-Coder-RLQwen/Qwen3.5-9Blcb:codegeneration|0268 problemslighteval endpoint litellm4096bfloat16max_new_tokens, same prompt/task, same serving stack, same evaluation harnesstemperature=0.0top_p=1.0seed=0max_new_tokens=1024codegen_pass@1:16 = 0.2015 +/- 0.0245codegen_pass@1:16 = 0.0336 +/- 0.011054 / 2689 / 268temperature=0.6top_p=0.95top_k=20min_p=0.0presence_penalty=0.0repetition_penalty=1.0max_new_tokens=1024codegen_pass@1:16 = 0.2388 +/- 0.0261codegen_pass@1:16 = 0.0261 +/- 0.009864 / 2687 / 2681export CUDA_VISIBLE_DEVICES=1
2vllm serve \
3 <PATH_TO_YOUR_RL_MERGED_MODEL> \
4 --host 0.0.0.0 \
5 --port 9001 \
6 --served-model-name bigatuna/Qwen3.5-9b-Sushi-Coder-RL \
7 --max-model-len 4096 \
8 --dtype bfloat16 \
9 --gpu-memory-utilization 0.451export CUDA_VISIBLE_DEVICES=0
2vllm serve \
3 Qwen/Qwen3.5-9B \
4 --host 0.0.0.0 \
5 --port 9002 \
6 --served-model-name Qwen/Qwen3.5-9B \
7 --max-model-len 4096 \
8 --dtype bfloat16 \
9 --gpu-memory-utilization 0.451cat > /tmp/lighteval_rl.yaml <<'EOF'
2model_parameters:
3 provider: "openai"
4 model_name: "openai/bigatuna/Qwen3.5-9b-Sushi-Coder-RL"
5 base_url: "http://localhost:9001/v1"
6 api_key: "dummy"
7 generation_parameters:
8 temperature: 0.0
9 max_new_tokens: 1024
10 top_p: 1.0
11 seed: 0
12EOF
13
14lighteval endpoint litellm \
15 /tmp/lighteval_rl.yaml \
16 'lcb:codegeneration|0' \
17 --output-dir /tmp/lcb_rl_full \
18 --save-details1cat > /tmp/lighteval_base.yaml <<'EOF'
2model_parameters:
3 provider: "openai"
4 model_name: "openai/Qwen/Qwen3.5-9B"
5 base_url: "http://localhost:9002/v1"
6 api_key: "dummy"
7 generation_parameters:
8 temperature: 0.0
9 max_new_tokens: 1024
10 top_p: 1.0
11 seed: 0
12EOF
13
14lighteval endpoint litellm \
15 /tmp/lighteval_base.yaml \
16 'lcb:codegeneration|0' \
17 --output-dir /tmp/lcb_base_full \
18 --save-details1cat > /tmp/lighteval_rl_t06.yaml <<'EOF'
2model_parameters:
3 provider: "openai"
4 model_name: "openai/bigatuna/Qwen3.5-9b-Sushi-Coder-RL"
5 base_url: "http://localhost:9001/v1"
6 api_key: "dummy"
7 generation_parameters:
8 temperature: 0.6
9 max_new_tokens: 1024
10 top_p: 0.95
11 top_k: 20
12 min_p: 0.0
13 presence_penalty: 0.0
14 repetition_penalty: 1.0
15EOF
16
17lighteval endpoint litellm \
18 /tmp/lighteval_rl_t06.yaml \
19 'lcb:codegeneration|0' \
20 --output-dir /tmp/lcb_rl_full_t06 \
21 --save-details1cat > /tmp/lighteval_base_t06.yaml <<'EOF'
2model_parameters:
3 provider: "openai"
4 model_name: "openai/Qwen/Qwen3.5-9B"
5 base_url: "http://localhost:9002/v1"
6 api_key: "dummy"
7 generation_parameters:
8 temperature: 0.6
9 max_new_tokens: 1024
10 top_p: 0.95
11 top_k: 20
12 min_p: 0.0
13 presence_penalty: 0.0
14 repetition_penalty: 1.0
15EOF
16
17lighteval endpoint litellm \
18 /tmp/lighteval_base_t06.yaml \
19 'lcb:codegeneration|0' \
20 --output-dir /tmp/lcb_base_full_t06 \
21 --save-details