Views
No views yet
<|im_start|>, <|im_patch|>, <|im_end|>pip install -r requirements.txt1from mlx_lm import load as mlx_load
2from model import HuihuiStep3VL
3
4# Load Qwen3-8B
5model, tokenizer = mlx_load("mlx-community/Qwen3-8B-Instruct-bf16")
6
7# Create VL model
8vl_model = HuihuiStep3VL(
9 llm_model=model,
10 vision_hidden=1536,
11 llm_hidden=4096,
12)
13
14# Generate with image
15response = vl_model.generate(
16 images=image_tensor,
17 prompt_tokens=prompt_tokens,
18 max_tokens=256,
19)1from sample import generate_response
2
3response = generate_response(
4 model=vl_model,
5 tokenizer=tokenizer,
6 image_base64=base64_encoded_image,
7 prompt="Describe this image.",
8)1from sample import generate_with_chat_messages
2
3messages = [
4 {"role": "user", "content": "What do you see in this image?"}
5]
6
7response = generate_with_chat_messages(
8 model=vl_model,
9 tokenizer=tokenizer,
10 messages=messages,
11 image=base64_image,
12)model.py - Model definition (VisionEncoder, ImageProjector, HuihuiStep3VL)loader.py - Weight loading utilitiestokenizer.py - Tokenizer with Step3 special tokenssample.py - Sample inference scriptsconvert.py - Weight conversion and hub push scriptpython convert.py<im_start> + N×<im_patch> + <im_end> where N = (H/patch_size) × (W/patch_size)