Views
No views yet
Qwen/Qwen2.5-1.5B-Instruct at inference time.| Base model | Qwen/Qwen2.5-1.5B-Instruct |
| Adaptation | LoRA, r=64, α=64, dropout 0.05, on all linear projections (q,k,v,o,gate,up,down) |
| Also trained | embeddings for the 8 added annotation tokens (<FACT>, </FACT>, <FACT_ID>, <QUESTION>, </QUESTION>, <ANSWER>, </ANSWER>, <DOC_SEP>) |
| Precision | bfloat16 |
| Sequence length | 8192 tokens |
<DOC_SEP>, then the question for one fact id.
The chat template is Qwen's default (no system prompt is supplied, so Qwen's default system block
is used — matching training).<document with <FACT>N<FACT_ID>span</FACT> tags><DOC_SEP>
What are the question and paraphrased answer for <FACT>N<FACT_ID>?<QUESTION>...</QUESTION><ANSWER>...</ANSWER>.1import torch
2from peft import PeftModel
3from transformers import AutoModelForCausalLM, AutoTokenizer
4
5adapter_id = "lil-lab/CoLMLM-Question-Generator"
6base_id = "Qwen/Qwen2.5-1.5B-Instruct"
7
8tokenizer = AutoTokenizer.from_pretrained(adapter_id)
9model = AutoModelForCausalLM.from_pretrained(base_id, dtype=torch.bfloat16)
10model = PeftModel.from_pretrained(model, adapter_id).eval()
11
12context = ("Marie Curie was born in <FACT>1<FACT_ID>Warsaw</FACT> in "
13 "<FACT>2<FACT_ID>1867</FACT> and won <FACT>3<FACT_ID>two</FACT> Nobel Prizes.")
14fact_id = 1
15
16user = (f"{context}<DOC_SEP>\n\n"
17 f"What are the question and paraphrased answer for <FACT>{fact_id}<FACT_ID>?\n")
18prompt = tokenizer.apply_chat_template([{"role": "user", "content": user}],
19 add_generation_prompt=True, tokenize=False)
20
21inputs = tokenizer(prompt, return_tensors="pt").to(model.device)
22with torch.no_grad():
23 output = model.generate(**inputs, max_new_tokens=64, do_sample=False)
24print(tokenizer.decode(output[0, inputs["input_ids"].shape[1]:], skip_special_tokens=False))
25# <QUESTION>Where was Marie Curie born?</QUESTION><ANSWER>Warsaw</ANSWER><|im_end|>1@misc{feldman2026colmlmcontinuousquerylimitedmemory,
2 title={Co-LMLM: Continuous-Query Limited Memory Language Models},
3 author={Yair Feldman and Linxi Zhao and Nathan Godey and Dongyoung Go and Yilun Hua and Kilian Q. Weinberger and Jennifer J. Sun and Yoav Artzi},
4 year={2026},
5 eprint={2607.07707},
6 archivePrefix={arXiv},
7 primaryClass={cs.CL},
8 url={https://arxiv.org/abs/2607.07707},
9}