Views
No views yet
torch.optim.AdamW (warmup_steps = 1e2, learning_rate = 5e-4, epsilon = 1e-8)<|startofinstruction|>What is a language model?<|endofinstruction|>A language model is a probability distribution over a vocabulary.<|endofcompletion|>1from transformers import AutoTokenizer, AutoModelForCausalLM
2import torch
3
4device = torch.device("cuda" if torch.cuda.is_available() else "cpu")
5
6tokenizer = AutoTokenizer.from_pretrained('nicholasKluge/Aira-2-1B1')
7aira = AutoModelForCausalLM.from_pretrained('nicholasKluge/Aira-2-1B1')
8
9aira.eval()
10aira.to(device)
11
12question = input("Enter your question: ")
13
14inputs = tokenizer(tokenizer.bos_token + question + tokenizer.sep_token,
15 add_special_tokens=False,
16 return_tensors="pt").to(device)
17
18responses = aira.generate(**inputs, num_return_sequences=2)
19
20print(f"Question: 👤 {question}\n")
21
22for i, response in enumerate(responses):
23 print(f'Response {i+1}: 🤖 {tokenizer.decode(response, skip_special_tokens=True).replace(question, "")}')1>>>Question: 👤 What is the capital of Brazil?
2
3>>>Response 1: 🤖 The capital of Brazil is Brasília.
4>>>Response 2: 🤖 The capital of Brazil is Brasília.| Model | Average | ARC | TruthfulQA | ToxiGen |
|---|---|---|---|---|
| Aira-2-1B1 | 42.55 | 25.26 | 50.81 | 51.59 |
| TinyLlama/TinyLlama-1.1B-intermediate-step-955k-token-2T | 37.52 | 30.89 | 39.55 | 42.13 |
1@misc{nicholas22aira,
2 doi = {10.5281/zenodo.6989727},
3 url = {https://github.com/Nkluge-correa/Aira},
4 author = {Nicholas Kluge Corrêa},
5 title = {Aira},
6 year = {2023},
7 publisher = {GitHub},
8 journal = {GitHub repository},
9}
10
11@phdthesis{kluge2024dynamic,
12 title={Dynamic Normativity},
13 author={Kluge Corr{\^e}a, Nicholas},
14 year={2024},
15 school={Universit{\"a}ts-und Landesbibliothek Bonn}
16}