NVIDIA– tag –
-
AI・テクノロジー
NVIDIAのKVキャッシュ移植が25倍速い理由を解剖する
LLMが2回目から速いのはKVキャッシュのおかげ。Qを保存しない理由、メモリ量の計算式、実測761倍の再利用まで平易に解説し、NVIDIAがキャッシュをモデル間で移植する新論文(2.7〜25倍速)まで読み切ります。 -
ローカルLLM
FreeTokenは8GB GPUで35B動く、RAM 32GBなら
FreeTokenをarXiv論文とGitHub公式ドキュメントで検証。8GB GPUで35Bが39.3 tok/s動くのは事実ですが、同じ機材にhost RAM 32GBが載っています。報道の速度比較表が別モデルの数値だった件と、macOS非対応の現状を実測ベースで解説します。
1