Interactive demo of per-layer embeddings: a matrix multiply uses every weight per token while an embedding table uses one row, and a toggle compares E2B's compute and memory cost with an imaginary plain 5B model.

One token's cost: multiply vs look up
Multiply versus lookup Matrix multiply Every weight works Embedding table One row per token
touched for this tokenidle
Where the 5 billion live
Memory placement Fast chip memoryScarce and quick Ordinary memoryBig and slower Core transformer2.3B of matmuls PLE tables, 2.7BFetched row by row
Compute per token2.3B
Fast memory needed2.3B
Ordinary memory used2.7B