Views
No views yet
Qwen3-1.7B KV cache into one
Qwen3-4B can generate from, so the prompt is prefilled once on the
small model instead of on the big one.1from kvbridge import Mapper, transfer
2
3mapper = Mapper.from_pretrained("Siddharth85/kvbridge-qwen3-1.7b-to-qwen3-4b")
4small_cache = small(prompt_ids, use_cache=True).past_key_values
5big_cache = transfer(small_cache, mapper)
6big.generate(input_ids=prompt_ids, past_key_values=big_cache, max_new_tokens=128)