搜尋 CarlStack

按 Esc 關閉;完整結果會顯示文章摘要、標籤與日期。

AI 工程化
5 分鐘
·

KV Cache 不是一個優化項:先分清楚你要減少的是容量、頻寬還是重複

從 Avi Chawla 的 KV cache 分類出發,將模型架構、token 保留、位元精度、配置重用與 offloading 變成一張 production capacity ledger,避免把不同代價誤當成同一個開關。

AI 工程化
5 分鐘
·

Attention 不是一條公式:用三個不變量看懂 LLM 的 Q、K、V 實作

從 Tech with Mak 的 Attention 手冊出發,用 tensor shape、mask direction 與 decode state 三個不變量檢查 Q/K/V、RoPE、KV cache 與 FlashAttention 的實作邊界,避免把數學、位置與 kernel 最佳化混成同一件事。

系統設計
9 分鐘
·

大模型推理引擎優化全景:KV Cache 記憶體碎片化、vLLM PagedAttention 與推測解碼實戰

深度拆解 LLM 大語言模型推理加速與顯存優化核心技術:剖析 Prefill 與 Decode 階段的計算與記憶體瓶頸;詳解 KV Cache 為何浪費 60%~80% 顯存;深入 vLLM PagedAttention 虛擬分頁區塊映射與零拷貝分叉;解析 Continuous Batching(持續批處理)與 Speculative Decoding(推測解碼)的吞吐翻倍實踐。