Views
No views yet
1import torch
2from transformers import AutoModel, AutoTokenizer
3
4MAX_SEQUENCE_LENGTH = 4096
5MODEL_NAME_OR_PATH = "markussagen/xlm-roberta-longformer-base-4096"
6
7tokenizer = AutoTokenizer.from_pretrained(
8 MODEL_NAME_OR_PATH,
9 max_length=MAX_SEQUENCE_LENGTH,
10 padding="max_length",
11 truncation=True,
12)
13
14model = AutoModelForQuestionAnswering.from_pretrained(
15 MODEL_NAME_OR_PATH,
16 max_length=MAX_SEQUENCE_LENGTH,
17)
18
191wget https://s3.amazonaws.com/research.metamind.io/wikitext/wikitext-103-raw-v1.zip
2unzip wikitext-103-raw-v1.zip
3
4export DATA_DIR=./wikitext-103-raw
5
6scripts/run_long_lm.py \
7 --model_name_or_path xlm-roberta-base \
8 --model_name xlm-roberta-to-longformer \
9 --output_dir ./output \
10 --logging_dir ./logs \
11 --val_file_path $DATA_DIR/wiki.valid.raw \
12 --train_file_path $DATA_DIR/wiki.train.raw \
13 --seed 42 \
14 --max_pos 4096 \
15 --adam_epsilon 1e-8 \
16 --warmup_steps 500 \
17 --learning_rate 3e-5 \
18 --weight_decay 0.01 \
19 --max_steps 6000 \
20 --evaluate_during_training \
21 --logging_steps 50 \
22 --eval_steps 50 \
23 --save_steps 6000 \
24 --max_grad_norm 1.0 \
25 --per_device_eval_batch_size 2 \
26 --per_device_train_batch_size 1 \
27 --gradient_accumulation_steps 64 \
28 --overwrite_output_dir \
29 --fp16 \
30 --do_train \
31 --do_eval