Views
No views yet
| Ours | Qwen3-235B-A22B-Thinking-2507 | Ours(previous) | |
|---|---|---|---|
| Humanity's Last Exam | |||
| Overall Accuracy (%) | 18.72 | 18.07 | 17.61 |
| Math | 26.13 | 26.54 | 24.90 |
| Physics | 12.87 | 10.89 | 10.40 |
| Biology/Medicine | 17.57 | 17.57 | 14.41 |
| Humanities/Social Science | 12.44 | 9.84 | 12.44 |
| Computer Science/AI | 13.39 | 11.16 | 12.22 |
| Engineering | 15.63 | 15.63 | 12.50 |
| Chemistry | 12.87 | 6.93 | 10.89 |
| Others | 3.98 | 5.11 | 8.05 |
| Calibration Error | 74.0 | 74.0 | 75.0 |
| Do-Not-Answer (10 fold) | |||
| Safety rate (%) | 97.87 | 95.74 | 95.74 |
max_model_len and max_completion_tokens across all models.
For HLE, we set max_model_len = 262,144 and max_completion_tokens = 248,741.
For DNA, max_model_len is the same and max_new_tokens = 512.
Additionally, we report the HLE score as judged by OpenAI o4-mini-2025-04-16.conda install -c conda-forge --file requirements.txt
pip install \
--index-url https://download.pytorch.org/whl/cu126 \
--extra-index-url https://pypi.org/simple \
torch==2.7.1+cu126 torchvision==0.22.1+cu126 torchaudio==2.7.1+cu126 \
vllm>=v0.10.1.1
(llmbench) $ pip list | grep vllm
vllm 0.10.1.1262144を、predict.pyのmax_completion_tokensパラメタは248741をかならず指定してください。
なお、predict.pyの実行完了までにかかる時間は25時間です(実績値):1#!/bin/bash
2#SBATCH --job-name=predict_full_hle_8gpu
3#SBATCH --partition=P06
4#SBATCH --nodelist=osk-gpu68
5#SBATCH --nodes=1
6#SBATCH --gpus-per-node=8
7#SBATCH --cpus-per-task=64
8#SBATCH --output=eval_hle/logs/%x-%j.out
9#SBATCH --error=eval_hle/logs/%x-%j.err
10
11#--- 作業ディレクトリ & logs --------------------------------------------
12export EVAL_DIR="eval_hle"
13mkdir -p "$EVAL_DIR/logs"
14echo "log dir : $EVAL_DIR/logs"
15
16#--- モジュール & Conda --------------------------------------------
17module purge
18module load cuda/12.6 miniconda/24.7.1-py312
19module load cudnn/9.6.0
20module load nccl/2.24.3
21source "$(conda info --base)/etc/profile.d/conda.sh"
22conda activate llmbench
23
24# 自分のトークンに置き換えてください
25HF_TOKEN=hf_yourtoken
26WANDB_API_KEY=yourkey
27OPENAI_API_KEY=sk-YOURKEY
28
29export HF_HOME=${SLURM_TMPDIR:-$HOME}/.hf_cache
30export HF_TOKEN=$HF_TOKEN
31export WANDB_API_KEY=$WANDB_API_KEY
32export HUGGINGFACE_HUB_TOKEN=$HF_TOKEN
33mkdir -p "$HF_HOME"
34echo "HF cache dir : $HF_HOME"
35
36export PYTHONUNBUFFERED=1
37export VLLM_LOGGING_LEVEL=DEBUG
38
39#--- vLLM 起動(8GPU)----------------------------------------------
40vllm serve weblab-llm-competition-2025-bridge/team-pont-neuf-Qwen3-235B-A22B-Thinking-sft-2510 \
41 --tensor-parallel-size 8 \
42 --pipeline-parallel-size 1 \
43 --max-model-len 262144 \
44 --max-num-seqs 32 \
45 --gpu-memory-utilization 0.95 \
46 --reasoning-parser deepseek_r1 \
47 --dtype "bfloat16" \
48 > $EVAL_DIR/logs/vllm-$SLURM_JOB_ID.log 2>&1 &
49pid_vllm=$!
50
51#--- ヘルスチェック -------------------------------------------------
52until curl -s http://127.0.0.1:8000/health >/dev/null; do
53 echo "$(date +%T) vLLM starting …"
54 sleep 10
55done
56echo "vLLM READY"
57
58#--- 推論 -----------------------------------------------------------
59cd $EVAL_DIR
60python predict.py \
61 model=weblab-llm-competition-2025-bridge/team-pont-neuf-Qwen3-235B-A22B-Thinking-sft-2510 \
62 dataset=cais/hle \
63 max_completion_tokens=248741 2>&1
64cd ..
65
66#--- 評価 -----------------------------------------------------------
67export BASE_URL="http://localhost:8000/v1"
68cd $EVAL_DIR
69python judge.py \
70 model=weblab-llm-competition-2025-bridge/team-pont-neuf-Qwen3-235B-A22B-Thinking-sft-2510 \
71 dataset=cais/hle \
72 max_completion_tokens=248741 2>&1
73cd ../
74
75#--- 後片付け -------------------------------------------------------
76kill $pid_vllm 2>/dev/null
77wait $pid_vllm 2>/dev/null
78
79wait262144をかならず指定してください:1#!/bin/bash
2#SBATCH --job-name=predict_dna_8gpu
3#SBATCH --partition=P06
4#SBATCH --nodelist=osk-gpu68
5#SBATCH --nodes=1
6#SBATCH --gpus-per-node=8
7#SBATCH --cpus-per-task=64
8#SBATCH --output=eval_dna/logs/%x-%j.out
9#SBATCH --error=eval_dna/logs/%x-%j.err
10
11#--- 作業ディレクトリ & logs --------------------------------------------
12export EVAL_DIR="eval_dna"
13mkdir -p "$EVAL_DIR/logs"
14echo "log dir : $EVAL_DIR/logs"
15
16#--- モジュール & Conda --------------------------------------------
17module purge
18module load cuda/12.6 miniconda/24.7.1-py312
19module load cudnn/9.6.0
20module load nccl/2.24.3
21source "$(conda info --base)/etc/profile.d/conda.sh"
22conda activate llmbench
23
24# 自分のトークンに置き換えてください
25HF_TOKEN=hf_yourtoken
26WANDB_API_KEY=yourkey
27OPENAI_API_KEY=sk-YOURKEY
28
29export HF_HOME=${SLURM_TMPDIR:-$HOME}/.hf_cache
30export HUGGINGFACE_HUB_TOKEN=$HF_TOKEN
31mkdir -p "$HF_HOME"
32echo "HF cache dir : $HF_HOME"
33
34#--- vLLM 起動(8GPU)----------------------------------------------
35vllm serve weblab-llm-competition-2025-bridge/team-pont-neuf-Qwen3-235B-A22B-Thinking-sft-2510 \
36 --tensor-parallel-size 8 \
37 --pipeline-parallel-size 1 \
38 --max-model-len 262144 \
39 --max-num-seqs 32 \
40 --gpu-memory-utilization 0.95 \
41 --reasoning-parser deepseek_r1 \
42 --dtype "bfloat16" \
43 > $EVAL_DIR/logs/vllm.log 2>&1 &
44pid_vllm=$!
45
46#--- ヘルスチェック -------------------------------------------------
47until curl -s http://127.0.0.1:8000/health >/dev/null; do
48 echo "$(date +%T) vLLM starting …"
49 sleep 10
50done
51echo "vLLM READY"
52
53#--- 推論 -----------------------------------------------------------
54python $EVAL_DIR/llm-compe-eval/evaluate_huggingface_models.py \
55 --model_name "weblab-llm-competition-2025-bridge/team-pont-neuf-Qwen3-235B-A22B-Thinking-sft" \
56 --dataset_path datasets/Instruction/do_not_answer_en.csv \
57 --output_dir $EVAL_DIR/evaluation_results \
58 --use_vllm \
59 --vllm_base_url http://localhost:8000/v1 > $EVAL_DIR/logs/predict.log 2>&1
60
61#--- 後片付け -------------------------------------------------------
62kill $pid_vllm
63wait