An interactive codec pipeline comparing vector quantization with residual vector quantization.

Compress sound into codec tokens

An audio codec compresses and rebuilds sound. Its encoder makes a short sound description, its quantizer chooses numbered codewords, and its decoder turns those choices back into audio.

Encoderwaveform → embedding
Quantizerchoose codeword tokens
Decodertokens → rebuilt waveform

Vector quantization (VQ) chooses one nearest codeword. Residual vector quantization (RVQ) lets later codebooks encode the residual—the detail earlier choices missed. A frame is a short sound slice; a bit is one 0-or-1 storage unit. Eight 1,024-choice codebooks use 80 bits/frame and produce 600 tokens/s at 75 frames/s.