Views
No views yet

Qwen3.8-27B-CIRU-ActiveFPX-PromptForge-v3-Q8-FFNEQ-LateQ6.gguf.
The GGUF can run by itself. The .pfs companions require the included CIRU
runtime patch and trade additional memory for faster prompt and draft-output
paths.Runtime requirement: the accelerated configuration requires the CIRU ROCmFPX v2.3 base plusruntime/qwen38-v3-output-k8-runtime.patch. The performance work was developed ongfx1151with TheRock ROCm 7.15. A stock llama.cpp binary can load the GGUF alone, but it cannot use the PromptForge companions or the Output-K8 proxy.
| Matched measure | Public v2 | V3 | Change |
|---|---|---|---|
| Perplexity ratio vs BF16 | 1.027876 | 1.016361 | better |
| Mean KLD vs BF16 | 0.036162 | 0.031457 | better |
| Same-top token agreement | 90.637% | 91.152% | +0.515 pp |
1d4bf0f2ff6012fd82039f2fa52739d0dd7c60c0. Its 5120-wide merger matches the
language model. Vision is enabled in the release profile on that structural and
provenance basis; an additional v3-specific image-plus-MTP runtime screen was
not run during publication.| File | Bytes | SHA-256 | Purpose |
|---|---|---|---|
Qwen3.8-27B-CIRU-ActiveFPX-PromptForge-v3-Q8-FFNEQ-LateQ6.gguf | 16,578,061,472 | 32e16a2daa8b185f4308b2f59a1548986bcdf3270a18d3d1b5708b0fa58e554c | Recommended v3 language model |
Qwen3.8-27B-CIRU-ActiveFPX-PromptForge-FFN.pfs | 17,123,004,416 | 98d4dc803914314f9b4769cb5bcd075226209803c468bfbac87b21695cea971f | Full-W8 FFN prompt view |
Qwen3.8-27B-CIRU-ActiveFPX-PromptForge-GDN.pfs | 4,029,685,760 | e9ccbc152492eb881026bd6adbfd1e6b7c8398b1b163319d9858d080f556a1b7 | Full-W8 Gated DeltaNet prompt view |
Qwen3.8-27B-CIRU-ActiveFPX-PromptForge-Output-K8.pfs | 715,165,696 | f6a2d9d1c33aebfe0ec9b92838193fe885fd3cdda0c9e8b9fb5acdfde4a942b7 | Draft-only top-8 proxy; final token is reranked by Q8 |
Qwen3.8-27B-mmproj-BF16.mmproj | 931,145,984 | 765e805687953f5b3625f0231b947ca630d9c67412372207b7c32eaa747c351d | GGUF-format BF16 vision projector |
runtime/qwen38-v3-output-k8-runtime.patch | 30,098 | 8ba7d721ea380b060aeb0c7595b8b05f1582c0f7bf7a4b89e0910bc8e72465d5 | Patch from public v2.3 runtime to the qualified Output-K8 runtime |
.pfs companions is
38,445,917,344 bytes (35.81 GiB). The GGUF alone is 15.44 GiB. The vision
projector adds 0.87 GiB when multimodal serving is enabled. Previous v1 and v2
artifacts remain in the repository for reproducibility, but v3 is the default.1sudo apt update
2sudo apt install -y build-essential cmake git ninja-build python3 libcurl4-openssl-dev
3
4export ROCM_PATH=/opt/rocm
5export PATH="$ROCM_PATH/bin:$ROCM_PATH/llvm/bin:$PATH"
6export LD_LIBRARY_PATH="$ROCM_PATH/lib:$ROCM_PATH/lib/llvm/lib${LD_LIBRARY_PATH:+:$LD_LIBRARY_PATH}"
7"$ROCM_PATH/bin/rocminfo" | grep -m1 gfx11511git clone https://github.com/ciru-ai/ROCmFPX.git
2cd ROCmFPX
3git checkout qwen3.8-activefpx-promptforge-v2.3
4git am /models/runtime/qwen38-v3-output-k8-runtime.patch
5
6git clone https://github.com/ROCm/composable_kernel.git ../composable_kernel
7git -C ../composable_kernel checkout fdf4bb7fcc984811cef48ce817d89aac064b984agfx1151 target:1cmake -S . -B build-promptforge -G Ninja \
2 -DCMAKE_BUILD_TYPE=Release \
3 -DCMAKE_C_COMPILER="$ROCM_PATH/llvm/bin/clang" \
4 -DCMAKE_CXX_COMPILER="$ROCM_PATH/llvm/bin/clang++" \
5 -DCMAKE_HIP_COMPILER="$ROCM_PATH/llvm/bin/clang++" \
6 -DCMAKE_PREFIX_PATH="$ROCM_PATH" \
7 -DGGML_HIP=ON -DGGML_CUDA=OFF -DGGML_VULKAN=OFF \
8 -DGGML_HIP_FORCE_MMQ=ON -DGGML_HIP_GRAPHS=ON \
9 -DGGML_HIP_MMQ_MFMA=ON -DGGML_HIP_NO_VMM=ON \
10 -DGGML_HIP_ROCWMMA_FATTN=OFF -DGGML_NATIVE=ON \
11 -DAMDGPU_TARGETS=gfx1151 -DGPU_BUILD_TARGETS=gfx1151 \
12 -DPROMPTFORGE_CK_ROOT="$PWD/../composable_kernel" \
13 -DGGML_BUILD_TESTS=OFF -DLLAMA_BUILD_TESTS=OFF \
14 -DLLAMA_BUILD_SERVER=ON
15
16cmake --build build-promptforge --target llama-server -j"$(nproc)"gfx1151..pfs companions, and the projector into
/models. Then launch with the exact non-IU4/no-ngram profile:1export ROCM_PATH=/opt/rocm
2export LD_LIBRARY_PATH="$PWD/build-promptforge/bin:$ROCM_PATH/lib:$ROCM_PATH/lib/llvm/lib${LD_LIBRARY_PATH:+:$LD_LIBRARY_PATH}"
3export HSA_OVERRIDE_GFX_VERSION=11.5.1
4export HIP_VISIBLE_DEVICES=0
5export GGML_CUDA_GRAPH_OPT=0
6
7export PROMPTFORGE_SIDECAR=/models/Qwen3.8-27B-CIRU-ActiveFPX-PromptForge-FFN.pfs
8export PROMPTFORGE_GDN_SIDECAR=/models/Qwen3.8-27B-CIRU-ActiveFPX-PromptForge-GDN.pfs
9export PROMPTFORGE_MODE=m2048_fused_tail1476
10export PROMPTFORGE_ENABLE_SMALLM_W8=1
11export PROMPTFORGE_MTP_OUTPUT_K8=1
12export PROMPTFORGE_MTP_OUTPUT_K8_VALIDATE=0
13export PROMPTFORGE_MTP_OUTPUT_K8_PROXY=/models/Qwen3.8-27B-CIRU-ActiveFPX-PromptForge-Output-K8.pfs
14
15unset LLAMA_MTP_CPU_ARGMAX_FASTPATH LLAMA_MTP_BACKEND_GREEDY
16unset PROMPTFORGE_IU4_SIDECAR PROMPTFORGE_GDN_IU4_SIDECAR
17unset PROMPTFORGE_ENABLE_NGRAM_MOD PROMPTFORGE_ENABLE_NGRAM_M65_IU4
18
19./build-promptforge/bin/llama-server \
20 -m /models/Qwen3.8-27B-CIRU-ActiveFPX-PromptForge-v3-Q8-FFNEQ-LateQ6.gguf \
21 --mmproj /models/Qwen3.8-27B-mmproj-BF16.mmproj \
22 --alias main --host 127.0.0.1 --port 8080 --jinja \
23 -fit off -dev ROCm0 -ngl 999 \
24 -c 262144 -b 2048 -ub 2048 -fa on \
25 -ctk f16 -ctv f16 -t 16 -tb 16 -np 1 \
26 -ctxcp 0 --cache-ram 0 --no-cache-prompt --no-cache-idle-slots \
27 --timeout 3600 --metrics \
28 --spec-type draft-mtp --spec-draft-device ROCm0 --spec-draft-ngl 999 \
29 --spec-draft-type-k f16 --spec-draft-type-v f16 \
30 --spec-draft-n-max 4 --spec-draft-n-min 0 \
31 --spec-draft-p-min 0.0 --spec-draft-p-split 0.10 \
32 --spec-draft-backend-sampling \
33 --temp 0.7 --top-p 0.95 \
34 --reasoning off --reasoning-format none --reasoning-budget -1.pfs files. Remove all
PROMPTFORGE_* environment variables and use a compatible GGUF runtime. This
retains the v3 tensor allocation and Q8 output head but not DualView prompt
acceleration or Output-K8 draft shortlisting.