Views
No views yet

1from transformers import AutoModel, AutoTokenizer
2
3model = AutoModel.from_pretrained("ccdv/lsg-bart-large-4096", trust_remote_code=True)
4tokenizer = AutoTokenizer.from_pretrained("ccdv/lsg-bart-large-4096")1from transformers import AutoModel
2
3model = AutoModel.from_pretrained("ccdv/lsg-bart-large-4096",
4 trust_remote_code=True,
5 num_global_tokens=16,
6 block_size=64,
7 sparse_block_size=64,
8 attention_probs_dropout_prob=0.0
9 sparsity_factor=4,
10 sparsity_type="none",
11 mask_first_token=True
12)sparse_block_size=0 or sparsity_type="none", only local attention is considered. sparsity_type="bos_pooling" (new)
sparsity_type="norm", select highest norm tokens
sparsity_type="pooling", use average pooling to merge tokens
sparsity_type="lsh", use the LSH algorithm to cluster similar tokens
sparsity_type="stride", use a striding mecanism per head
sparsity_type="block_stride", use a striding mecanism per head
1from transformers import AutoModelForSeq2SeqLM, AutoTokenizer
2
3model = AutoModelForSeq2SeqLM.from_pretrained("ccdv/lsg-bart-large-4096",
4 trust_remote_code=True,
5 pass_global_tokens_to_decoder=True, # Pass encoder global tokens to decoder
6)
7tokenizer = AutoTokenizer.from_pretrained("ccdv/lsg-bart-large-4096")
8
9SENTENCE = "This is a test sequence to test the model. " * 300
10token_ids = tokenizer(
11 SENTENCE,
12 return_tensors="pt",
13 #pad_to_multiple_of=... # Optional
14 truncation=True
15 )
16output = model(**token_ids)1from transformers import AutoModelForSequenceClassification, AutoTokenizer
2
3model = AutoModelForSequenceClassification.from_pretrained("ccdv/lsg-bart-large-4096",
4 trust_remote_code=True,
5 pass_global_tokens_to_decoder=True, # Pass encoder global tokens to decoder
6)
7tokenizer = AutoTokenizer.from_pretrained("ccdv/lsg-bart-large-4096")
8
9SENTENCE = "This is a test sequence to test the model. " * 300
10token_ids = tokenizer(
11 SENTENCE,
12 return_tensors="pt",
13 padding="max_length", # Optional but recommended
14 truncation=True # Optional but recommended
15 )
16output = model(**token_ids)
17
18> SequenceClassifierOutput(loss=None, logits=tensor([[-0.3051, -0.1762]], grad_fn=<AddmmBackward>), hidden_states=None, attentions=None)@article{DBLP:journals/corr/abs-1910-13461,
author = {Mike Lewis and
Yinhan Liu and
Naman Goyal and
Marjan Ghazvininejad and
Abdelrahman Mohamed and
Omer Levy and
Veselin Stoyanov and
Luke Zettlemoyer},
title = {{BART:} Denoising Sequence-to-Sequence Pre-training for Natural Language
Generation, Translation, and Comprehension},
journal = {CoRR},
volume = {abs/1910.13461},
year = {2019},
url = {http://arxiv.org/abs/1910.13461},
eprinttype = {arXiv},
eprint = {1910.13461},
timestamp = {Thu, 31 Oct 2019 14:02:26 +0100},
biburl = {https://dblp.org/rec/journals/corr/abs-1910-13461.bib},
bibsource = {dblp computer science bibliography, https://dblp.org}
}