Views
No views yet
| Details | |
|---|---|
| Method | W8A8 FP8 Dynamic |
| Weights | FP8 (E4M3), per-channel, symmetric |
| Activations | FP8 (E4M3), dynamic per-token, symmetric |
| Ignored layers | lm_head |
| Format | compressed-tensors |
| Calibration data | None required (PTQ) |
<think> tags for structured internal reasoning before providing answers.<think> blocks1from vllm import LLM, SamplingParams
2
3model = LLM(model="BarraHome/Qwen3.5-27B-Claude-4.6-Opus-FP8-Dynamic")
4sampling_params = SamplingParams(max_tokens=2048, temperature=0.6)
5output = model.generate(["Hello, tell me about yourself"], sampling_params)
6print(output[0].outputs[0].text)1from transformers import AutoModelForCausalLM, AutoTokenizer
2
3model = AutoModelForCausalLM.from_pretrained(
4 "BarraHome/Qwen3.5-27B-Claude-4.6-Opus-FP8-Dynamic",
5 device_map="auto",
6 trust_remote_code=True,
7)
8tokenizer = AutoTokenizer.from_pretrained(
9 "BarraHome/Qwen3.5-27B-Claude-4.6-Opus-FP8-Dynamic",
10 trust_remote_code=True,
11)
12
13input_ids = tokenizer("Hello my name is", return_tensors="pt").input_ids.to(model.device)
14output = model.generate(input_ids, max_new_tokens=100)
15print(tokenizer.decode(output[0]))1from transformers import AutoModelForCausalLM, AutoTokenizer
2from llmcompressor import oneshot
3from llmcompressor.modifiers.quantization import QuantizationModifier
4
5model = AutoModelForCausalLM.from_pretrained(
6 "Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled",
7 dtype="auto",
8 low_cpu_mem_usage=True,
9 trust_remote_code=True,
10)
11
12recipe = QuantizationModifier(
13 targets="Linear",
14 scheme="FP8_DYNAMIC",
15 ignore=["lm_head"],
16)
17
18oneshot(model=model, recipe=recipe, output_dir="Qwen3.5-27B-Claude-4.6-Opus-FP8-Dynamic")