LiveMem-RL is the reinforcement-learning checkpoint of LiveMem-4B-SFT. It
uses a Qwen3 attention path in parallel with a Gated DeltaNet 2 (GDN2)
recurrent memory path at every decoder layer:
LiveMem uses custom model code and GDN2 Triton kernels. A CUDA environment is
required for inference.
1import torch
2from transformers import AutoModelForCausalLM, AutoTokenizer
3
4model_id = "chen-l/LiveMem-4B-RL"
5tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
6model = AutoModelForCausalLM.from_pretrained(
7 model_id,
8 trust_remote_code=True,
9 dtype=torch.bfloat16,
10 device_map="auto",
11)
12
13messages = [{"role": "user", "content": "Answer using the supplied long context."}]
14inputs = tokenizer.apply_chat_template(
15 messages,
16 add_generation_prompt=True,
17 return_tensors="pt",
18 return_dict=True,
19).to(model.device)
20outputs = model.generate(**inputs, max_new_tokens=256)
21print(tokenizer.decode(outputs[0][inputs.input_ids.shape[1]:], skip_special_tokens=True))