The whitespace here was put to make the alert more visible.
Ivme-Conversate-XL-v1-Base
Conversate-XL-v1 Logo
Dense decoder-only transformer, 125.6M parameters, trained from
scratch by IvmeLabs. Part of the Conversate family — see the
IvmeLabs organization page for related
models (Conversate-S, mainline Conversate, and this XL tier).
RMSNorm (pre-norm), tied input/output embeddings, no bias terms
Vocabulary: 16000 tokens (BPE)
Max sequence length: 1024
Training
Trained on a 5.0B-token mix (backbone: DCLM-baseline,
FineWeb-Edu, FineMath; supplement: Wikipedia-en, Project Gutenberg-en) using
Muon (body weights) + AdamW (embeddings/norms), on a single AMD Instinct
MI300X (ROCm 7.14.0, PyTorch 2.12.0).
Usage
python
1from transformers import AutoModelForCausalLM, AutoTokenizer
23model = AutoModelForCausalLM.from_pretrained(4"IvmeLabs/Ivme-Conversate-XL-v1-Base", trust_remote_code=True5)6tokenizer = AutoTokenizer.from_pretrained("IvmeLabs/Ivme-Conversate-XL-v1-Base")78inputs = tokenizer("Hello, my name is", return_tensors="pt")9outputs = model.generate(inputs["input_ids"], max_new_tokens=50)10print(tokenizer.decode(outputs[0]))
Note: requires trust_remote_code=True since this uses a custom
architecture (modeling_ivme.py in this repo), not a built-in
transformers model class. Review that file before trusting it, as with
any trust_remote_code=True model.