Views
No views yet
[!WARNING] WARNING: This model has been deprecated and is no longer recommended.
For the latest and actively maintained models, please visit our BSC‑LT organization:
https://huggingface.co/BSC-LT
1>>> from transformers import AutoTokenizer, AutoModelForCausalLM, pipeline, set_seed
2>>> tokenizer = AutoTokenizer.from_pretrained("PlanTL-GOB-ES/gpt2-large-bne")
3>>> model = AutoModelForCausalLM.from_pretrained("PlanTL-GOB-ES/gpt2-large-bne")
4>>> generator = pipeline('text-generation', tokenizer=tokenizer, model=model)
5>>> set_seed(42)
6>>> generator("La Biblioteca Nacional de España es una entidad pública y sus fines son", num_return_sequences=5)
7
8[{'generated_text': 'La Biblioteca Nacional de España es una entidad pública y sus fines son servir como herramienta básica en la difusión de la cultura. '},
9{'generated_text': 'La Biblioteca Nacional de España es una entidad pública y sus fines son el desarrollo de la educación, la cultura y el conocimiento, promoviendo actividades a través de Internet con la información que recibe del acceso a los fondos que en ella se almacenan. '},
10{'generated_text': 'La Biblioteca Nacional de España es una entidad pública y sus fines son la publicación y difusión cultural. '},
11{'generated_text': 'La Biblioteca Nacional de España es una entidad pública y sus fines son preservar y difundir los fondos y colecciones de la Biblioteca Nacional, así como servir de punto de encuentro para toda la comunidad científica, la academia y para la sociedad civil. '},
12{'generated_text': 'La Biblioteca Nacional de España es una entidad pública y sus fines son la conservación, estudio y difusión del Patrimonio Bibliográfico en cualquiera de sus formas así como la formación y perfeccionamiento de los especialistas e investigadores en el campo de la información y de las bibliotecas.'}]1>>> from transformers import AutoTokenizer, GPT2Model
2>>> tokenizer = AutoTokenizer.from_pretrained("PlanTL-GOB-ES/gpt2-large-bne")
3>>> model = GPT2Model.from_pretrained("PlanTL-GOB-ES/gpt2-large-bne")
4>>> text = "La Biblioteca Nacional de España es una entidad pública y sus fines son"
5>>> encoded_input = tokenizer(text, return_tensors='pt')
6>>> output = model(**encoded_input)
7>>> print(output.last_hidden_state.shape)
8torch.Size([1, 14, 1280])1>>> from transformers import AutoTokenizer, AutoModelForCausalLM, pipeline, set_seed
2>>> tokenizer = AutoTokenizer.from_pretrained("PlanTL-GOB-ES/gpt2-large-bne")
3>>> model = AutoModelForCausalLM.from_pretrained("PlanTL-GOB-ES/gpt2-large-bne")
4>>> generator = pipeline('text-generation', tokenizer=tokenizer, model=model)
5>>> set_seed(42)
6>>> generator("El hombre se dedica a", num_return_sequences=5)
7[{'generated_text': 'El hombre se dedica a comprar móviles a sus padres, pero les paga por ellos y luego les devuelve la pasta a ella. '},
8{'generated_text': 'El hombre se dedica a la venta ambulante ilegal en la zona de la Alameda, con puestos del rastro callejero o de supermercados a los que luego roba. '},
9{'generated_text': 'El hombre se dedica a la venta ambulante en el Paseo de Melilla. '},
10{'generated_text': 'El hombre se dedica a los tatuajes y los dibujos en el cuerpo con su apariencia física y no da a basto en las tareas domésticas. '},
11{'generated_text': 'El hombre se dedica a la caza indiscriminada de animales. '}]
12
13>>> set_seed(42)
14>>> generator("La mujer se dedica a", num_return_sequences=5)
15[{'generated_text': 'La mujer se dedica a comprar móviles a sus padres, pero les paga por ellos y luego no paga la factura." '},
16{'generated_text': 'La mujer se dedica a la venta ambulante y su pareja vende cupones en el mercadillo navideño. '},
17{'generated_text': 'La mujer se dedica a la venta al por mayor de perfumes, cosmética, complementos, y otros bienes de consumo. '},
18{'generated_text': 'La mujer se dedica a los servicios sexuales y se aprovecha de los servicios religiosos. '},
19{'generated_text': 'La mujer se dedica a la prostitución y tiene dos hijas del matrimonio y la propia familia de la víctima. '}]| Corpora | Number of documents | Number of tokens | Size (GB) |
|---|---|---|---|
| BNE | 201,080,084 | 135,733,450,668 | 570GB |
@article{,
abstract = {We want to thank the National Library of Spain for such a large effort on the data gathering and the Future of Computing Center, a
Barcelona Supercomputing Center and IBM initiative (2020). This work was funded by the Spanish State Secretariat for Digitalization and Artificial
Intelligence (SEDIA) within the framework of the Plan-TL.},
author = {Asier Gutiérrez Fandiño and Jordi Armengol Estapé and Marc Pàmies and Joan Llop Palao and Joaquin Silveira Ocampo and Casimiro Pio Carrino and Carme Armentano Oller and Carlos Rodriguez Penagos and Aitor Gonzalez Agirre and Marta Villegas},
doi = {10.26342/2022-68-3},
issn = {1135-5948},
journal = {Procesamiento del Lenguaje Natural},
keywords = {Artificial intelligence,Benchmarking,Data processing.,MarIA,Natural language processing,Spanish language modelling,Spanish language resources,Tractament del llenguatge natural (Informàtica),Àrees temàtiques de la UPC::Informàtica::Intel·ligència artificial::Llenguatge natural},
publisher = {Sociedad Española para el Procesamiento del Lenguaje Natural},
title = {MarIA: Spanish Language Models},
volume = {68},
url = {https://upcommons.upc.edu/handle/2117/367156#.YyMTB4X9A-0.mendeley},
year = {2022},
}