Views
No views yet
<|startoftext|>, <|endoftext|>) were used to delineate conversational turns in the dialogue data, allowing the model to learn conversational structure.gpt2 (from Hugging Face Transformers)Trainer APItransformers library in Python for text generation:1from transformers import pipeline, AutoTokenizer, AutoModelForCausalLM
2import torch
3
4model_name = "nickoo004/gpt2_karakalpak"
5tokenizer = AutoTokenizer.from_pretrained(model_name)
6model = AutoModelForCausalLM.from_pretrained(model_name)
7
8
9device = 0 if torch.cuda.is_available() else -1
10karakalpak_generator = pipeline('text-generation', model=model, tokenizer=tokenizer, device=device)
11
12
13prompt_text = "Nókis qalası"
14generated_text = karakalpak_generator(prompt_text, max_new_tokens=50, num_return_sequences=1)[0]['generated_text']
15print(f"Generated text: {generated_text}")
16
17
18dialog_prompt = "<|startoftext|>Ayta alasiz ba, sizdi kim jaratqan?<|sep|>"
19generated_dialog = karakalpak_generator(dialog_prompt, max_new_tokens=100, num_return_sequences=1, pad_token_id=tokenizer.eos_token_id)[0]['generated_text']
20if '<|endoftext|>' in generated_dialog:
21 generated_dialog = generated_dialog.split('<|endoftext|>')[0]
22print(f"Generated dialogue: {generated_dialog}")