Google Cloud 在 SEMICON Taiwan 2026 指出,AI 运算已从算力受限转向记忆体受限,高效能记忆体占 AI 伺服器硬体成本逾 75%。为突破瓶颈,Google 推出硬体分流策略:TPU 8i 针对低延迟推论,配备 288 GB HBM 及扩增 SRAM;TPU 8t 专攻超大规模训练,以 9600 颗晶片组成 2 PB HBM 共享池。软体方面发表 TurboQuant 无损量化演算法,将键值快取压缩至 3 位元,记忆体占用缩小 6 倍,注意力运算加速 8 倍,并导入旧世代 DRAM 整合技术延长生命周期。