Skip to content
Open
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
2 changes: 1 addition & 1 deletion README.md
Original file line number Diff line number Diff line change
Expand Up @@ -303,7 +303,7 @@ python3 download_pdfs.py # The code is generated by Doubao AI

|Date|Title|Paper|Code|Recom|
|:---:|:---:|:---:|:---:|:---:|
|2026.03|🔥🔥[**NexusQuant**] NexusQuant: Training-Free KV Cache Compression via E8 Lattice Quantization and Temporal Predictive Coding7x compression, -2.26% PPL on Mistral-7B, drop-in one-liner| [[code]](https://github.com/nexusquant/nexusquant)|[[nexusquant]](https://github.com/nexusquant/nexusquant) ![](https://img.shields.io/github/stars/nexusquant/nexusquant.svg?style=social)|⭐️⭐️ |
|2026.03|🔥🔥[**NexusQuant**] NexusQuant: Training-Free KV Cache Compression via E8 Lattice Quantization and Attention-Aware Token Eviction6.1x compression, +0.276% PPL on Mistral-7B, drop-in one-liner| [[code]](https://github.com/jagmarques/nexusquant)|[[jagmarques]](https://github.com/jagmarques/nexusquant) ![](https://img.shields.io/github/stars/jagmarques/nexusquant.svg?style=social)|⭐️⭐️ |
|2019.11|🔥[MQA] Fast Transformer Decoding: One Write-Head is All You Need(@Google) | [[pdf]](https://arxiv.org/pdf/1911.02150.pdf)|⚠️|⭐️⭐️ |
|2022.06|[LTP] Learned Token Pruning for Transformers(@UC Berkeley etc)| [[pdf]](https://arxiv.org/pdf/2107.00910.pdf)|[[LTP]](https://github.com/kssteven418/LTP) ![](https://img.shields.io/github/stars/kssteven418/LTP.svg?style=social)|⭐️ |
|2023.05|🔥🔥[**GQA**] GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints(@Google) | [[pdf]](https://arxiv.org/pdf/2305.13245.pdf)|[[flaxformer]](https://github.com/google/flaxformer) ![](https://img.shields.io/github/stars/google/flaxformer.svg?style=social) |⭐️⭐️ |
Expand Down