1defgenerate_text(prompt, max_tokens=50, temperature=0.8, top_k=40):2 ids = tokenizer.encode(prompt.lower())3 input_ids = torch.tensor([ids]).to(device)4 output = model.generate(input_ids, max_new_tokens=max_tokens,5 temperature=temperature, top_k=top_k)6return tokenizer.decode(output[0].tolist())78# Coba berbagai prompt9prompts =["indonesia adalah","pendidikan","teknologi","jakarta",10"ekonomi","kebudayaan","demokrasi","hutan"]1112for p in prompts:13 result = generate_text(p)14print(f"Prompt: \"{p}\"")15print(f"Output: {result[:100]}")16print("-"*60)
Cell 4 - Retrain Model di Kaggle (Opsional)
python
1# Jika ingin retrain dengan data sendiri:2import shutil, os
34# Copy file ke working directory5work_dir ="/kaggle/working/slm"6os.makedirs(work_dir, exist_ok=True)7for f in os.listdir(model_dir):8 shutil.copy2(os.path.join(model_dir, f), os.path.join(work_dir, f))910os.chdir(work_dir)1112# Edit train.py sesuai kebutuhan, lalu:13# !python train.py
Tips Kaggle:
Gunakan GPU P100 (gratis) untuk training lebih cepat
Aktifkan GPU: Settings > Accelerator > GPU
Kaggle sudah pre-install PyTorch, jadi tidak perlu install ulang
Training Details
Detail
Data
KBBI PDF (1,844 halaman, 21,627 entri, ~1.9M token) + curated Indonesian corpus