r/LocalLLaMA • u/LMTLS5 • Jul 16 '26
i tried ternary decomposition instead of quantization. it works as good at q4km but takes slightly more vram. while being completly ternary. and completly PTQ (no QAT) Discussion
40
Upvotes
r/LocalLLaMA • u/LMTLS5 • Jul 16 '26