Views
No views yet
Please refer to our new GitHub Wiki which documents our efforts in detail in creating the open source version of GitHub Copilot
1python run_clm_apps.py \
2 --output_dir $HOME/gpt-neo-125M-apps \
3 --model_name_or_path EleutherAI/gpt-neo-125B \
4 --dataset_name $HOME/gpt-code-clippy/data_processing/apps.py \
5 --dataset_config_name formatted \
6 --do_train --do_eval \
7 --block_size="1024" \
8 --per_device_train_batch_size="16" \
9 --per_device_eval_batch_size="16" \
10 --preprocessing_num_workers="16" \
11 --learning_rate="8e-5" \
12 --warmup_steps="800" \
13 --adam_beta1="0.9" \
14 --adam_beta2="0.98" \
15 --weight_decay="0.1" \
16 --overwrite_output_dir \
17 --num_train_epochs="5" \
18 --logging_steps="50" \
19 --eval_steps="2000" \
20 --report_to="wandb" \
21 --dtype="bfloat16" \
22 --save_strategy epoch \
23 --gradient_accumulation_steps 2 \
24 --all_data true \1from transformers import AutoModelForCausalLM, AutoTokenizer, FlaxAutoModelForCausalLM
2
3model = AutoModelForCausalLM.from_pretrained("flax-community/gpt-code-clippy-125M-apps-alldata")
4tokenizer = AutoTokenizer.from_pretrained("flax-community/gpt-code-clippy-125M-apps-alldata")
5
6prompt = """
7A function to greet user. Given a user name it should say hello
8
9def greet(name):
10
11ANSWER:
12"""
13
14input_ids = tokenizer(prompt, return_tensors='pt').input_ids.to(device)
15start = input_ids.size(1)
16out = model.generate(input_ids, do_sample=True, max_length=50, num_beams=2,
17 early_stopping=True, eos_token_id=tokenizer.eos_token_id, )
18
19print(tokenizer.decode(out[0][start:]))