IT之家 10月4日消息,Qwen3.8-27B是一款性能不错的人工智能模型,但前提是设备必须拥有足够的顯存與系統內存。搭載M4 Pro芯片的MacBook Pro僅有24GB統一內存,在運行該AI模型時,預填充速度會因此受到限制。據Wccftech報導,有一名用戶透過USB-C接口將iPhone17Pro Max外接至這台便攜Mac電腦上,並借助自制軟件,使得該AI模型的預填充性能最高提升了44%。

IT之家注意到,為了突破這臺Mac 24GB統一內存的上限,Reddit用戶“u/ StayLameBro”採用了兩種方法,將運算任務拆分後交給Mac本機和iPhone 17個Pro Max協同處理。針對預填充加速,MacBook Pro負責處理每批256個token中的第1至40層,再將激活值數據流傳輸到手機端;同時,iPhone利用A19 Pro的GPU運行第41至64層,而Mac這邊則已經開始處理下一批數據。依靠GPU運算,手機端的運行速度相比不使用GPU時提升了約2.4倍。
在整個方案中,神經網絡引擎也沒有被閒置。每16K長度的舊上下文會被編譯成一組神經網絡引擎模型。在140K上下文長度下,與僅使用A19 Pro的GPU相比,單獨使用token的寫入時間從279毫秒縮短至176毫秒。以將一個包含2000個token的文件預填充並保存會話這項任務來看性能表現:當上下文設定為8K時,僅依靠Mac本機的速度是每秒132個token;接上外部iPhone之後,速度達到每秒177個token,性能提升了35%。當上下文設定為16K時,速度從每秒109個token上升至每秒157個token,增幅高達44%。
當上下文窗口設定為 32K 時,預填充速度從每秒 101 個 token 提升至每秒 130 個 token,性能改善了 29%。將 iPhone 17 Pro Max 外接在 M4 Pro 版 MacBook Pro 上,使用這套自製軟件,理論上應該可以獲得非常出色的預填充速度。可惜正如這位 Reddit 使用者所指出的,現實並非如此美好,這套方案仍存在若干限制。舉例來說,在 64K 以內的場景中,手機並不會加速文本生成,文本生成的工作依然全部由 Mac 完成。
另外值得一提的是,驅動 iPhone 18 Pro 以及 iPhone 18 Pro Max 的 A20 Pro 芯片有望提供更大的性能餘量。一方面它本身的整體性能更強;另一方面它配備雙 16 核神經網絡引擎。據稱,針對專門適配神經網絡處理器的任務,這款引擎的數據吞吐能力甚至超過該系統級芯片內置的 7 核 GPU。這套自制軟件目前已開源,可以在 GitHub 上下載,項目名稱叫做“backburner”。
即便僅僅作為一項實驗,也能看出預填充速度提升帶來的收益相當可觀。後續自然還有繼續挖掘性能潛力的空間;不過這也許也意味著,未來 iPhone 這類設備也有可能步入與內存、固態硬盤一樣的供貨緊缺階段。











