Views
No views yet
| データセット | 種類 | 件数 |
|---|---|---|
| jensjepsen/esperanto-hplt-filtered | CPT | ~50k |
| jensjepsen/esperanto-sentences | CPT | ~20k |
| jensjepsen/esperanto-gutenberg | CPT | ~134 |
| jensjepsen/esperanto-sft-creative | SFT | ~21k |
| jensjepsen/esperanto-sft-dolly | SFT | ~15k |
| jensjepsen/esperanto-alpaca-cleaned | SFT | ~48k |
1from transformers import AutoTokenizer, AutoModelForCausalLM
2import torch
3
4model_id = "taniatsu/SmolLM2-135M-esperanto"
5tokenizer = AutoTokenizer.from_pretrained(model_id)
6model = AutoModelForCausalLM.from_pretrained(model_id, torch_dtype=torch.bfloat16)
7
8prompt = "<|im_start|>user\nSkribu mallongan rakonton pri la maro.<|im_end|>\n<|im_start|>assistant\n"
9inputs = tokenizer(prompt, return_tensors="pt")
10outputs = model.generate(**inputs, max_new_tokens=200, do_sample=True, temperature=0.7)
11print(tokenizer.decode(outputs[0], skip_special_tokens=True))