Views
No views yet
| Source | Dataset | Share | What it is |
|---|---|---|---|
| case-law | HFforLegal/case-law (us config) | ~39% (~863M tokens) | US court opinions (scanned; some OCR noise) |
| sec | PleIAs/SEC | ~39% (~861M tokens) | SEC filings (10-K, etc.), born-digital |
| fineweb-edu | HuggingFaceFW/fineweb-edu (sample-10BT) | ~21% (~465M tokens) | General educational web text, added as fluency filler |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3repo = "srinivasch87/slm125live-base"
4tokenizer = AutoTokenizer.from_pretrained(repo)
5model = AutoModelForCausalLM.from_pretrained(repo)
6
7prompt = "The plaintiff argued that"
8inputs = tokenizer(prompt, return_tensors="pt")
9output = model.generate(
10 **inputs,
11 max_new_tokens=128,
12 do_sample=True,
13 temperature=0.8,
14 top_p=0.95,
15 top_k=50,
16)
17print(tokenizer.decode(output[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))