TurboQuant

How Google Compresses LLM Memory 6× Without Losing a Single Answer

Based on TurboQuant: Online Vector Quantization with Near-Optimal Distortion Rate (Google Research)

TurboQuant overview
▦ 17 sections
⚙ 6 parts
Begin Presentation →