vllm.model_executor.layers.quantization.utils.moe_wna16_utils ¶
Functions:
-
repack_int4_to_int32–Repack [E, N, K//2] uint8 → [E, K, N//8] int32.
-
unpack_zp_int4_to_fp16–Unpack [E, N//2, K_groups] uint8 → [E, K_groups, N] fp16.
repack_int4_to_int32(w) ¶
Repack [E, N, K//2] uint8 → [E, K, N//8] int32.
Input: K-packed uint8 (2 int4 per byte, low nibble first). Output: N-packed int32 (8 int4 per int32, GPTQ sequential shifts [0,4,...,28]).
Source code in vllm/model_executor/layers/quantization/utils/moe_wna16_utils.py
unpack_zp_int4_to_fp16(zp) ¶
Unpack [E, N//2, K_groups] uint8 → [E, K_groups, N] fp16.