優化 Transformer 模型服務參數 – Apple Silicon GPU 的案例 2026 年 7 月 11 日 一台 MacBook Pro M4 Max、一個開源 MoE 模型,針對推論優化的一次實戰:為什麼讓 LLM 的吞吐量崩跌 100 倍的是 prefill(而不是 decode),以及兩個針對 prefill 部分的優化。