Views
No views yet



1conda create -n promptr1 python==3.12 -y
2conda activate promptr1
3cd verl
4pip3 install -e .
5pip3 install vllm==0.8.3
6pip3 install flash-attn==2.7.4.post1 # Download: https://github.com/Dao-AILab/flash-attention/releases
7pip3 install FlagEmbedding faiss-cpu
8pip3 install debugpy==1.8.0 "ray[default]" debugpyOur datasets are in:
1Training Dataset: dataset\train_data
2Evaluation Dataset: dataset\eval_data1API_KEY = "your_api_key"
2MODEL = "model_name"
3BASE_URL = "url"Run:
nohup bash run_prompt-R1.sh > Prompt-R1_training.out &1# Create environment
2conda create -n vllmapi python=3.12 -y
3conda activate vllmapi
4# Install dependencies
5pip3 install transformers accelerate huggingface_hub
6pip3 install vllmnohup bash vllm_api.sh > api.out 2>&1 &Edit agent_r1/tool/tools/search_tool.py and set the local API endpoint and model name
base_url = "http://<SERVER_IP>:8006/v1"1export CHECKPOINT_DIR='checkpoints/Prompt-R1/Prompt-R1-qwen3-4b-gpt-4o-mini/global_step_320/actor'
2export HF_MODEL_PATH='./Qwen/Qwen3-4B'
3export TARGET_DIR='./merge_model/Prompt-R1_Qwen3-4B'export MODEL_NAME='./merge_model/Prompt-R1_Qwen3-4B'python inference.py1python batch_inference.py
2python eval_scores.py1@misc{liu2025promptr1collaborativeautomaticprompting,
2 title={Prompt-R1: Collaborative Automatic Prompting Framework via End-to-end Reinforcement Learning},
3 author={Wenjin Liu and Haoran Luo and Xueyuan Lin and Haoming Liu and Tiesunlong Shen and Jiapu Wang and Rui Mao and Erik Cambria},
4 year={2025},
5 eprint={2511.01016},
6 archivePrefix={arXiv},
7 primaryClass={cs.CL},
8 url={https://arxiv.org/abs/2511.01016},
9}