Views
No views yet

1from transformers import AutoModel, AutoTokenizer
2
3model = AutoModel.from_pretrained("ccdv/lsg-barthez-4096", trust_remote_code=True)
4tokenizer = AutoTokenizer.from_pretrained("ccdv/lsg-barthez-4096")1from transformers import AutoModel
2
3model = AutoModel.from_pretrained("ccdv/lsg-barthez-4096",
4 trust_remote_code=True,
5 num_global_tokens=16,
6 block_size=64,
7 sparse_block_size=64,
8 attention_probs_dropout_prob=0.0
9 sparsity_factor=4,
10 sparsity_type="none",
11 mask_first_token=True
12)sparse_block_size=0 or sparsity_type="none", only local attention is considered. sparsity_type="bos_pooling" (new)
sparsity_type="norm", select highest norm tokens
sparsity_type="pooling", use average pooling to merge tokens
sparsity_type="lsh", use the LSH algorithm to cluster similar tokens
sparsity_type="stride", use a striding mecanism per head
sparsity_type="block_stride", use a striding mecanism per head
1from transformers import AutoModelForSeq2SeqLM, AutoTokenizer
2
3model = AutoModelForSeq2SeqLM.from_pretrained("ccdv/lsg-barthez-4096",
4 trust_remote_code=True,
5 pass_global_tokens_to_decoder=True, # Pass encoder global tokens to decoder
6)
7tokenizer = AutoTokenizer.from_pretrained("ccdv/lsg-barthez-4096")
8
9SENTENCE = "This is a test sequence to test the model. " * 300
10token_ids = tokenizer(
11 SENTENCE,
12 return_tensors="pt",
13 padding="max_length", # Optional but recommended
14 truncation=True # Optional but recommended
15 )
16output = model(**token_ids)1from transformers import AutoModelForSequenceClassification, AutoTokenizer
2
3model = AutoModelForSequenceClassification.from_pretrained("ccdv/lsg-barthez-4096",
4 trust_remote_code=True,
5 pass_global_tokens_to_decoder=True, # Pass encoder global tokens to decoder
6)
7tokenizer = AutoTokenizer.from_pretrained("ccdv/lsg-barthez-4096")
8
9SENTENCE = "This is a test sequence to test the model. " * 300
10token_ids = tokenizer(
11 SENTENCE,
12 return_tensors="pt",
13 #pad_to_multiple_of=... # Optional
14 truncation=True
15 )
16output = model(**token_ids)
17
18> SequenceClassifierOutput(loss=None, logits=tensor([[-0.3051, -0.1762]], grad_fn=<AddmmBackward>), hidden_states=None, attentions=None)@article{eddine2020barthez,
title={BARThez: a Skilled Pretrained French Sequence-to-Sequence Model},
author={Eddine, Moussa Kamal and Tixier, Antoine J-P and Vazirgiannis, Michalis},
journal={arXiv preprint arXiv:2010.12321},
year={2020}
}