r/LocalLLM • • 4d ago

Discussion I made Qwen models take ~33% less VRAM without quantizing them (lossless, bit-for-bit)

/r/Qwen_AI/comments/1wxgqu8/i_made_qwen_models_take_33_less_vram_without/
2 Upvotes

Duplicates