Views
No views yet
1from transformers import GPT2LMHeadModel, GPT2Tokenizer
2
3repo_id = "BikoRiko/GPT-2.4"
4# ignore_mismatched_sizes=True is critical for the 2048-token configuration
5model = GPT2LMHeadModel.from_pretrained(repo_id, ignore_mismatched_sizes=True)
6tokenizer = GPT2Tokenizer.from_pretrained(repo_id)
7
8input_text = "Artificial intelligence will shape the future by"
9inputs = tokenizer(input_text, return_tensors='pt')
10
11outputs = model.generate(
12 **inputs,
13 max_length=150,
14 do_sample=True,
15 top_p=0.95,
16 repetition_penalty=1.2,
17 no_repeat_ngram_size=3
18)
19
20print(tokenizer.decode(outputs[0], skip_special_tokens=True))1import math
2from datasets import load_dataset
3from transformers import Trainer, TrainingArguments, GPT2LMHeadModel, GPT2Tokenizer
4
5repo_id = "BikoRiko/GPT-2.4"
6model = GPT2LMHeadModel.from_pretrained(repo_id, ignore_mismatched_sizes=True)
7tokenizer = GPT2Tokenizer.from_pretrained(repo_id)
8tokenizer.pad_token = tokenizer.eos_token
9
10# Load test split
11test_data = load_dataset('wikitext', 'wikitext-2-raw-v1', split='test')
12
13def tokenize(batch):
14 res = tokenizer(batch['text'], truncation=True, padding='max_length', max_length=128)
15 res['labels'] = res['input_ids'].copy()
16 return res
17
18tokenized_test = test_data.map(tokenize, batched=True)
19
20trainer = Trainer(model=model, args=TrainingArguments(output_dir='./tmp_eval'))
21eval_results = trainer.evaluate(tokenized_test)
22ppl = math.exp(eval_results['eval_loss'])
23
24print(f"Verified Test Perplexity: {ppl:.2f}")