Views
No views yet
| Kategori | Elemen | Jumlah Token (M) | Persentase |
|---|---|---|---|
| DTP | Okupasi PON TIK, Tren Pekerjaan, Kompetensi & SDM, Kebijakan & Regulasi DTP, Teknologi Digital Talent | 94 | 43.9% |
| PRD | Judi Online, Hoax, Perlindungan Anak, Konten Edukasi, Kebijakan & Regulasi PRD, Kekerasan Masyarakat | 92 | 42.9% |
| Wikipedia ID | Pengetahuan Umum Berbahasa Indonesia | 28.2 | 13.2% |
| Total | – | 214.2 | 100% |
1import torch
2from transformers import AutoTokenizer, AutoModelForCausalLM
3
4# 1. Configuration
5model_id = "aitfindonesia/Bakat-8B-Base" # Replace with your actual Hub ID
6
7# 2. Load Model
8# Use bfloat16 for A100/A10G, float16 for T4
9tokenizer = AutoTokenizer.from_pretrained(model_id)
10model = AutoModelForCausalLM.from_pretrained(
11 model_id,
12 torch_dtype=torch.bfloat16,
13 device_map="auto"
14)
15
16# 3. Inference Example (Completion)
17input_text = "Strategi utama untuk mengurangi gap talenta digital di Indonesia adalah"
18inputs = tokenizer(input_text, return_tensors="pt").to("cuda")
19
20with torch.no_grad():
21 outputs = model.generate(
22 **inputs,
23 max_new_tokens=100,
24 do_sample=True,
25 temperature=0.7
26 )
27 print(tokenizer.decode(outputs[0], skip_special_tokens=True))