Views
No views yet
conf/config.yaml)1dataset: cais/hle
2
3provider: vllm # [vllm]
4base_url: http://localhost:8000/v1
5
6model: weblab-llm-competition-2025-bridge/RAMEN-MISO
7max_completion_tokens: 35000
8reasoning: true
9
10# sample with multimodal is 2500, so text-only sample is about 2400
11num_workers: 2500
12max_samples: 2500
13
14judge: o3-mini-2025-01-311#!/bin/bash
2#SBATCH --job-name=qwen3_8gpu
3#SBATCH --partition=P01
4#SBATCH --nodelist=osk-gpu51
5#SBATCH --nodes=1
6#SBATCH --gpus-per-node=8
7#SBATCH --cpus-per-task=240
8#SBATCH --time=24:00:00
9#SBATCH --output=/home/Competition2025/adm/X006/logs/%x-%j.out
10#SBATCH --error=/home/Competition2025/adm/X006/logs/%x-%j.err
11#SBATCH --export=OPENAI_API_KEY="openai_api_keyをここに"
12#--- モジュール & Conda --------------------------------------------
13module purge
14module load cuda/12.6 miniconda/24.7.1-py312
15module load cudnn/9.6.0
16module load nccl/2.24.3
17source "$(conda info --base)/etc/profile.d/conda.sh"
18conda activate llmbench
19
20# Hugging Face 認証
21export HF_TOKEN= "<huggingface_tokenをここに>"
22export HF_HOME=${SLURM_TMPDIR:-$HOME}/.hf_cache
23export TRANSFORMERS_CACHE=$HF_HOME
24export HUGGINGFACE_HUB_TOKEN=$HF_TOKEN
25mkdir -p "$HF_HOME"
26echo "HF cache dir : $HF_HOME" # デバッグ用
27
28#--- メモリ/性能チューニング ------------------------------------------
29# ベスト構成での推奨:拡張セグメントでメモリ断片化を低減
30export PYTORCH_CUDA_ALLOC_CONF="expandable_segments:True"
31
32#--- GPU 監視 -------------------------------------------------------
33nvidia-smi -i 0,1,2,3,4,5,6,7 -l 3 > nvidia-smi.log &
34pid_nvsmi=$!
35
36#--- vLLM 起動(8GPU)----------------------------------------------
37# ベスト構成での推奨:rope-scaling なし / reasoning-parser なし
38# - tensor-parallel=4, pipeline-parallel=2
39# - enable-expert-parallel
40# - disable-custom-all-reduce
41# - gpu-memory-utilization=0.90
42vllm serve weblab-llm-competition-2025-bridge/REMEN-MISO \
43 --tensor-parallel-size 4 \
44 --pipeline-parallel-size 2 \
45 --enable-expert-parallel \
46 --gpu-memory-utilization 0.90 \
47 --disable-custom-all-reduce \
48 > vllm.log 2>&1 &
49pid_vllm=$!
50
51#--- ヘルスチェック -------------------------------------------------
52until curl -s http://127.0.0.1:8000/health >/dev/null; do
53 echo "$(date +%T) vLLM starting …"
54 sleep 10
55done
56echo "vLLM READY"
57
58#--- 推論 -----------------------------------------------------------
59python predict.py > predict.log 2>&1
60
61#--- 評価 -----------------------------------------------------------
62OPENAI_API_KEY=xxx python judge.py
63
64#--- 後片付け -------------------------------------------------------
65kill $pid_vllm
66kill $pid_nvsmi
67waitjobs/ray_cluster.shを使用してray clusterを起動してください。その時partitionやnodelist、ログファイルを設定してください。1#!/bin/bash
2#SBATCH --job-name=qwen3_8gpu
3#SBATCH --partition=P01
4#SBATCH --nodelist=osk-gpu51
5#SBATCH --nodes=1
6#SBATCH --gpus-per-node=8
7#SBATCH --cpus-per-task=240
8#SBATCH --time=24:00:00
9#SBATCH --output=/home/Competition2025/adm/X006/logs/%x-%j.out
10#SBATCH --error=/home/Competition2025/adm/X006/logs/%x-%j.err
11#SBATCH --export=OPENAI_API_KEY="openai_api_keyをここに"
12#--- モジュール & Conda --------------------------------------------
13module purge
14module load cuda/12.6 miniconda/24.7.1-py312
15module load cudnn/9.6.0
16module load nccl/2.24.3
17source "$(conda info --base)/etc/profile.d/conda.sh"
18conda activate llmbench
19
20# Hugging Face 認証
21export HF_TOKEN= "<huggingface_tokenをここに>"
22export HF_HOME=${SLURM_TMPDIR:-$HOME}/.hf_cache
23export TRANSFORMERS_CACHE=$HF_HOME
24export HUGGINGFACE_HUB_TOKEN=$HF_TOKEN
25mkdir -p "$HF_HOME"
26echo "HF cache dir : $HF_HOME" # デバッグ用
27
28#--- メモリ/性能チューニング -------------------------------------------
29# ベスト構成での推奨:拡張セグメントでメモリ断片化を低減
30export PYTORCH_CUDA_ALLOC_CONF="expandable_segments:True"
31
32#--- GPU 監視 -------------------------------------------------------
33nvidia-smi -i 0,1,2,3,4,5,6,7 -l 3 > nvidia-smi.log &
34pid_nvsmi=$!
35
36#--- 必要なディレクトリを作成 -----------------------------------------
37mkdir -p evaluation_results
38
39#--- vLLM 起動(8GPU)----------------------------------------------
40# ベスト構成での推奨:rope-scaling なし / reasoning-parser なし
41# - tensor-parallel=4, pipeline-parallel=2
42# - enable-expert-parallel
43# - disable-custom-all-reduce
44# - gpu-memory-utilization=0.90
45vllm serve weblab-llm-competition-2025-bridge/REMEN-MISO \
46 --tensor-parallel-size 4 \
47 --pipeline-parallel-size 2 \
48 --enable-expert-parallel \
49 --gpu-memory-utilization 0.90 \
50 --disable-custom-all-reduce \
51 > vllm.log 2>&1 &
52pid_vllm=$!
53
54#--- ヘルスチェック -------------------------------------------------
55until curl -s http://127.0.0.1:8000/health >/dev/null; do
56 echo "$(date +%T) vLLM starting …"
57 sleep 10
58done
59echo "vLLM READY"
60
61#--- 推論 -----------------------------------------------------------
62python llm-compe-eval/evaluate_huggingface_models.py \
63 --model_name "weblab-llm-competition-2025-bridge/RAMEN-MISO" \
64 --dataset_path datasets/Instruction/do_not_answer_en.csv \
65 --output_dir evaluation_results \
66 --use_vllm \
67 --max_questions 939 \
68 --vllm_base_url http://localhost:8000/v1 > predict.log 2>&1
69
70#--- 後片付け -------------------------------------------------------
71kill $pid_vllm
72kill $pid_nvsmi
73wait| Benchmark | DeepSeek R1 0528 Qwen3 8B | Qwen3 235B A22B | MISO |
|---|---|---|---|
| Humanity's Last Exam (text-only) | 6.46 ±1.96 | 11.75 ±1.36 | ?? |
| Humanity's Last Exam Extract120 (text-only) | 4.85 ±4.15 | 11.54 ±6.14 | 19.33 ±7.10 |
| Do-Not-Answer | 97.2 | 97.9 | 92.0 |