Views
No views yet
Qwen3_5ForConditionalGeneration: 24 capas con stack hibrido 3:1
(18 linear_attention + 6 full_attention) y torre de vision incluida.model.safetensors)max_position_embeddings)transformers >= 5.2 (soporte de model_type: qwen3_5). El
contenedor por defecto de Inference Endpoints no es compatible: usa
huggingface-inference-toolkit, clavado a transformers==4.51.3.1from transformers import AutoProcessor, AutoModelForImageTextToText
2
3model = AutoModelForImageTextToText.from_pretrained(
4 "GParlatto/spoky-qwen-merged-v2",
5 dtype="auto",
6 device_map="auto",
7)
8processor = AutoProcessor.from_pretrained("GParlatto/spoky-qwen-merged-v2")
9
10messages = [{"role": "user", "content": "Hola, quien eres?"}]
11inputs = processor.apply_chat_template(
12 messages, tokenize=True, add_generation_prompt=True,
13 return_dict=True, return_tensors="pt",
14).to(model.device)
15
16out = model.generate(**inputs, max_new_tokens=200)
17print(processor.batch_decode(out[:, inputs["input_ids"].shape[-1]:],
18 skip_special_tokens=True)[0])<|im_end|> (248046). El
generation_config.json acepta tanto ese como <|endoftext|> (248044).