Views
No views yet
original and scheme_a_threshold_0p0008 experiments, so the workflow can be reproduced on another machine.checkpoints/helpfulness/arm_beta_0p5/final_checkpointcheckpoints/harmlessness/arm_beta_0p01/final_checkpointcheckpoints/helpfulness/arm_beta_0p5_masked_round4_extreme/final_checkpointcheckpoints/harmlessness/arm_beta_0p01_masked_round4_extreme/final_checkpointcode/evaluation/PKU-SafeRLHF/generate_outputs_Beaver.py
--force_temperature override support has been removed in this copy.code/evaluation/PKU-SafeRLHF/gpt4_eval_Beaver.pycode/evaluation/PKU-SafeRLHF/gpt4_eval_Beaver_humanness_single.pycode/pku_safe_rlhf_repro/generate_old_genarm_custom_scheme.pycode/pku_safe_rlhf_repro/gpt4_eval_Beaver_local_shard.pycode/pku_safe_rlhf_repro/gpt4_eval_Beaver_humanness_single_local_shard.pycode/pku_safe_rlhf_repro/helpfulness_scheme_interface.pycode/pku_safe_rlhf_repro/prepare_eval728_without_train_overlap_500.pycode/pku_safe_rlhf_repro/merge_generation_shards.pycode/pku_safe_rlhf_repro/merge_beaver_eval_shards.pycode/pku_safe_rlhf_repro/merge_beaver_humanness_single_shards.pycode/pku_safe_rlhf_repro/run_eval728_without_train_overlap_500_old_genarm_balance.shcode/language-model-arithmetic/src/model_arithmeticdata/evaluation_prompts-full-728_without_train_overlap_500.jsongenerate_old_genarm_custom_scheme.py has been made portable:
PKU-Alignment/alpaca-7b-reproducedrun_eval728_without_train_overlap_500_old_genarm_balance.sh has been rewritten to use repository-relative paths instead of the original HPC absolute paths.generate_outputs_Beaver.py in this repository no longer accepts --force_temperature; original generation always follows the script's internal temperature rule.model_arithmetic is on PYTHONPATH.1pip install -r requirements.txt
2export PYTHONPATH="$PWD/code/evaluation/PKU-SafeRLHF:$PWD/code/language-model-arithmetic/src:$PYTHONPATH"1cd code/evaluation/PKU-SafeRLHF
2python generate_outputs_Beaver.py \
3 --model_base_name_or_path PKU-Alignment/alpaca-7b-reproduced \
4 --model_arm_helpfulness_name_or_path ../../../checkpoints/helpfulness/arm_beta_0p5/final_checkpoint \
5 --model_arm_harmlessness_name_or_path ../../../checkpoints/harmlessness/arm_beta_0p01/final_checkpoint \
6 --alpha_helpfulness 0 \
7 --alpha_harmlessness 6 \
8 --model_name_for_logging alpaca-7b-reproduced \
9 --model_arm_helpfulness_name_for_logging arm_beta_0p5 \
10 --model_arm_harmlessness_name_for_logging arm_beta_0p01 \
11 --datasets ../../../data/evaluation_prompts-full-728_without_train_overlap_500.json \
12 --output_dir ../../../runs/example_original \
13 --resume False \
14 --rewarded_soups False \
15 --seed 01cd code/pku_safe_rlhf_repro
2python generate_old_genarm_custom_scheme.py \
3 --prompt_file ../../data/evaluation_prompts-full-728_without_train_overlap_500.json \
4 --output_dir ../../runs/example_scheme_a \
5 --model_name_for_logging example_scheme_a \
6 --alpha_helpfulness 0 \
7 --alpha_harmlessness 6 \
8 --base_prob_threshold 0.0008 \
9 --seed 0runs/figure6_eval728_without_train_overlap_500_seed0_fast/models/base/generation.jsonruns/figure6_eval728_without_train_overlap_500_seed0_fast/models/base/evaluations_humanness_single_llama3_70b/base.jsonJUDGE_MODEL1export JUDGE_MODEL=/path/to/Meta-Llama-3-70B-Instruct
2export BASE_MODEL_PATH=PKU-Alignment/alpaca-7b-reproduced
3bash code/pku_safe_rlhf_repro/run_eval728_without_train_overlap_500_old_genarm_balance.sh 01export DECODE_VARIANT=scheme_a_threshold_0p0008
2export ALPHA_HELPFULNESS=0
3export ALPHA_HARMLESSNESS=6