Views
No views yet
| Source | HF dataset | Tokens | Share |
|---|---|---|---|
| Case law | HFforLegal/case-law (US) | ~715M | ~35% |
| SEC filings | PleIAs/SEC | ~860M | ~42% |
| Web (educational) | HuggingFaceFW/fineweb-edu | ~464M | ~23% |
| Total | ~2.04B |
casehold/LexGLUE
case_hold eval sets were stripped, so downstream legal-QA benchmarks (e.g.
CaseHOLD) are not contaminated.torchrun, bf16, torch.compile, flash-SDPA, fused AdamW| Domain | Val perplexity |
|---|---|
| SEC (financial) | 6.32 |
| Case law (legal) | 11.21 |
| Web (fineweb-edu) | 29.00 |
| Overall | 12.71 |
1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3tok = AutoTokenizer.from_pretrained("rahulreddyhanu/slm-125m-legal-financial")
4model = AutoModelForCausalLM.from_pretrained("rahulreddyhanu/slm-125m-legal-financial")
5
6ids = tok("The plaintiff shall bear the burden of proving", return_tensors="pt")
7ids.pop("token_type_ids", None)
8out = model.generate(**ids, max_new_tokens=60, do_sample=True, temperature=0.8, top_p=0.95)
9print(tok.decode(out[0], skip_special_tokens=True))