Views
No views yet
1LlamaConfig(
2 vocab_size=16384,
3 hidden_size=512,
4 intermediate_size=2048,
5 num_hidden_layers=12,
6 num_attention_heads=8,
7 num_key_value_heads=4,
8 max_position_embeddings=2048,
9 rms_norm_eps=1e-5,
10 rope_theta=10000.0,
11 hidden_act='silu'
12)1TrainingArguments(
2 num_train_epochs=2,
3 per_device_train_batch_size=16,
4 gradient_accumulation_steps=4,
5 learning_rate=1e-4,
6 weight_decay=0.1,
7 lr_scheduler_type="cosine",
8 warmup_ratio=0.05,
9 max_grad_norm=1.0,
10 fp16=True
11)1from transformers import AutoTokenizer, AutoModelForCausalLM
2
3tokenizer = AutoTokenizer.from_pretrained("harsha-desaraju/telugu-llama-small")
4model = AutoModelForCausalLM.from_pretrained("harsha-desaraju/telugu-llama-small")
5
6inputs = tokenizer("ఎందరో మహానుభావులు అందరికి ", return_tensors="pt")
7outputs = model.generate(**inputs, max_length=50)
8print(tokenizer.decode(outputs[0]))