新聞與見解 | 科騰科技

深入智慧網路層

作者:黃雷 | 2026年9月8日 上午12:30:01
核心觀點

過去幾年,AI 基礎架構的重點主要放在智慧究竟在哪裡被計算。下一個挑戰,則是這些智慧如何被連結起來。

隨著 AI 推論逐步分散至雲端、邊緣與終端裝置,應用效能越來越取決於運算資源部署位置、網路狀態與資料流動之間的協同關係。這些已不再是彼此獨立的架構決策。

我們已經開始在產業中看到這種趨勢,包括推論感知路由、分散式模型服務,以及邊雲協同等能力的出現。我們認為,這些變化正在帶來一種新的基礎架構需求:網路層不僅需要理解應用意圖與即時網路狀態,也需要能夠據此動態調整。

本文將進一步探討,為什麼這項轉變值得關注,以及為什麼網路正逐漸成為 AI 技術堆疊的一部分。

為什麼 AI 需要的不只是連線

在網際網路發展的大部分時間裡,各個環節的分工都相對清楚。應用決定要完成什麼任務,運算資源負責處理請求,而網路則負責在兩者之間建立連線並傳輸資料。

這種分工能夠長期有效,是因為底層通訊模式相對穩定。對多數應用而言,網路可以被視為一種傳輸基礎架構:它非常重要,但通常與應用本身的邏輯相對獨立。

分散式 AI 正開始打破這項假設。

隨著推論不斷分散至雲端、邊緣與終端裝置,應用效能越來越取決於運算資源位於何處、資料存放在哪裡、資訊能夠多快在不同位置之間流動,以及當網路狀態發生變化時,底層基礎架構能否即時作出反應。

因此,網路所扮演的角色也正在改變,從單純提供連線,逐步走向更主動的協同與協調。

推論正在改變基礎架構

第一波 AI 基礎架構投資的重點,大多集中在模型訓練。這並不令人意外。訓練前沿大型模型需要高度集中的運算能力,因此,大規模 GPU 叢集與集中式 AI 運算中心自然成為主流架構選擇。

推論則不同。

推論發生在每一次模型被實際呼叫的時候。隨著 AI 逐漸融入客戶互動、企業工作流程、搜尋、推薦、自動化以及自主系統,推論已從偶發的運算任務,逐漸轉變為一種必須在真實業務環境中持續、穩定運作的生產工作負載。

智慧代理應用進一步放大了這項特性。一個請求可能涉及資訊檢索、規劃、推論、策略檢查、多次模型呼叫,以及與外部工具或其他智慧代理的互動。每一個步驟都可能依賴前一步的結果,因此,延遲不再只是某一個環節的獨立問題,而會在整個任務鏈中持續累積。

生產環境的資料已經開始反映這項變化。在 Akamai 2026 年針對 AI 推論技術決策者的調查中,82% 的受訪者表示,其最重要的 AI 應用要求端到端回應時間不超過 500 毫秒;其中 64% 的應用要求低於 250 毫秒。同一份研究也顯示,50% 的受訪企業認為,在尖峰負載下維持可接受的延遲,是擴展推論業務時最困難的問題之一。

這意味著一項重要變化:AI 基礎架構的設計,已經不能只考慮「哪裡有最多算力」,還必須考慮決策需要在哪裡發生、需要哪些資料,以及運算與資料能否足夠快速地匯聚在一起。

運算正在走向更分散式的形態

這並不意味著所有 AI 工作負載都應該移往邊緣。

集中式基礎架構仍將在模型訓練、微調以及高運算強度推論中發揮關鍵作用,因為大型 GPU 叢集在這些場景下依然具有明顯的效能與經濟優勢。

真正發生變化的是,推論帶來了更豐富、更複雜的運算位置需求。

有些工作負載需要靠近使用者,因為回應速度至關重要;有些需要靠近資料,因為長距離傳輸大量資料並不經濟;有些必須依賴特定類型的 AI 加速器,而這些硬體可能只部署在特定位置;還有一些任務,則完全可以在規模較小的分散式基礎架構上執行。

具身智慧(Physical AI)尤其能夠體現這種差異。一台機器人可能在本地執行即時控制,在附近的邊緣基礎架構上進行感知或軌跡規劃,同時依賴雲端系統完成更高層次的推論或長週期規劃。端、邊、雲並不是彼此取代,而是在同一個分散式系統中扮演不同角色。

產業實務也開始朝這個方向演進,只是實際部署仍落後於架構需求。Akamai 的研究顯示,60% 的受訪者認為靠近使用者與決策點非常重要或至關重要,但與此同時,仍有 46% 的企業將推論運行在單一集中式雲端區域中。

這個落差非常值得關注。

架構演進的方向正在逐漸清晰,但基礎架構本身尚未完全跟上。

路由正在變得更懂工作負載

一旦運算資源分布在多個位置,問題就會變得更加複雜。

選擇正確的目標,不再只是找到最近或負載最低的伺服器那麼簡單。

AI 工作負載帶來更多需要納入考量的狀態資訊。例如:某個節點是否已經載入所需模型?是否已經快取可重複使用的上下文?合適的加速器是否可用?GPU 目前的負載如何?如果切換到另一個位置,降低的網路延遲是否足以抵銷遷移成本?

這些考量已經開始進入實際生產基礎架構。

以 Kubernetes Gateway API Inference Extension 為例,它在傳統閘道能力之上加入針對 AI 推論的路由機制。系統不再只依據標準 HTTP 或基礎架構訊號來分配請求,也可以結合模型識別、請求優先級與即時服務指標,選擇更合適的推論端點。

NVIDIA Dynamo 也在分散式模型服務中採用了類似概念。其路由機制可以參考 KV 快取重疊程度以及目前工作節點的負載,將請求傳送到更有可能高效執行任務的運算節點。

需要特別強調的是,這些機制主要運作在推論服務層,而不是底層網路傳輸層。但它們共同說明了一項重要的架構變化:

路由決策正在越來越理解它所承載的工作負載。

這與傳統靜態路由,或單純依據網路拓撲進行轉送,已經有明顯不同。

當資料流動成為運算的一部分

當推論本身進一步被拆分並採分散式執行時,運算與網路之間的關係會變得更加緊密。

在大型語言模型服務中,可以將 Prefill 階段,也就是處理輸入 Prompt 的階段,與 Decode 階段,也就是逐步產生 Token 的階段分離,並分別運行在不同的 GPU 資源池中。這樣做的原因是,這兩個階段對運算資源的需求特性並不完全相同。

這種架構可以提升 GPU 使用效率,但同時也引入了新的依賴關係:Prefill 階段產生的中間模型狀態,必須足夠高效地傳輸到 Decode 節點,否則,運算拆分所帶來的效率提升,就可能被資料傳輸過程中的延遲抵銷。

NVIDIA Dynamo 的架構明確將高效 KV 快取傳輸視為分散式推論服務的重要組成部分。

這個例子反映了一個更普遍的規律:

當運算開始採分散式執行,運算節點之間的資料流動,也會成為整體運算效率的一部分。

一些新興標準研究也開始從網路角度討論相同的問題。2026 年 7 月的一份 IETF Internet-Draft,就大規模分散式推論的傳輸問題,討論了 KV 快取傳輸、路徑負載感知、流量導向以及差異化可靠性等需求。

這些工作仍處於探索階段,並不是已經形成產業共識的標準,但它們釋放出一個重要訊號:分散式推論正在產生跨越運算與網路傳輸的新型基礎架構需求。

因此,運算編排與網路編排之間的界線,正在逐漸變得模糊。

從連線走向協同

傳統網路主要回答的是一個連線問題:

一個端點能否以足夠的頻寬與可接受的效能連接到另一個端點?

分散式 AI 增加了第二個問題:

在當下這個時刻,結合應用真正需要什麼,以及基礎架構正在經歷什麼,通訊究竟應該如何進行?

這項差異非常重要,因為運算環境與網路環境都在持續變化。某條網路路徑可能突然壅塞,某個推論區域可能接近容量上限,無線連線可能發生波動,而最有價值的模型狀態也可能已經存在於另一個位置。

目前,企業主要透過負載平衡、流量導向、重試、備援路徑、可觀測性工具以及人工維運等方式來處理這些情況。Akamai 2026 年的研究顯示,64% 的受訪者認為流量導向對生產級 AI 推論「非常重要」或「至關重要」,而 AI 營運成熟度更高的企業,對執行期間控制的重視程度也更高。

與此同時,一些新興 IETF 工作也開始研究運算與網路之間更緊密的協同。近期關於分散式推論的 Internet-Draft 已經涉及邊雲協作、智慧調度、可預測的延遲表現,以及運算與網路聯合可視化等議題。

這些都還不是已經確立的標準,但它們所探索的方向值得關注:

運算資源放在哪裡,以及網路應該如何運作,正在越來越多地被視為彼此相互依賴的問題。

智慧網路層正在浮現

我們認為,這些變化正在共同指向一種新的基礎架構能力,我們將其描述為智慧網路層(Intelligent Network Layer)

它不是一種新的網路通訊協定,也不是用來取代 IP 網路、SD-WAN、雲端基礎架構、推論閘道或邊緣平台。

更準確地說,它是一種協同層,將兩類資訊結合起來:應用需要什麼,以及目前基礎架構能夠提供什麼。

從網路端來看,這些資訊可能包括延遲、封包遺失、壅塞、路徑可用性與地理位置;從應用與運算端來看,則可能包括工作負載優先級、模型位置、加速器可用性、快取狀態以及服務等級要求。

它的目的,並不是讓網路替應用做決策。應用仍然決定「要完成什麼」;智慧網路層協助解決的,是「為了完成這個目標,必要的資料應該如何到達合適的運算資源,並滿足應用所需要的運行條件」。

這一點非常重要。

我們並不是在說,網路會突然變成一個可以自主思考的 AI 系統。

我們認為真正發生的是:為了有效支援分散式 AI,網路需要擁有更多上下文、更完整的可視性,以及更即時的執行期間控制能力。

可靠性正在成為執行期間屬性

這種演進,也正在改變我們對「可靠性」的理解。

傳統基礎架構通常透過可用性、平均延遲與總吞吐量等彙總指標來衡量效能。這些指標依然重要,但即時 AI 對一致性以及高百分位效能的要求正在變得更高。

問題已經不只是某項服務在一個月內是否保持可用,而是當分散式應用需要作出決策的那個瞬間,通訊是否依然穩定。

這也是為什麼生產級 AI 營運團隊越來越關注 p95、p99 延遲,建立故障切換路徑,並持續投入流量導向與更快速的復原機制。Akamai 的研究顯示,已經運行生產級推論的企業,越來越重視高百分位效能與執行期間韌性,而不再只看平均表現。

對即時智慧系統而言,可靠性因此不再只是一項靜態 SLA 指標。

它必須在應用運行過程中持續被維持。

這意味著,可觀測性、路徑多樣性、復原速度以及執行期間自適應能力,正在從傳統的網路維運問題,逐漸成為應用效能的一部分。

網路正在成為 AI 技術堆疊的一部分

這些變化絲毫不會削弱模型與 AI 加速器的重要性。

運算依然是現代 AI 的基礎。

但僅有運算,並不能構成一個真正的分散式智慧系統。

模型需要靠近資料,推論需要觸及使用者,智慧代理需要與應用以及其他智慧代理互動,邊緣系統需要與雲端平台協同,而具身智慧系統則必須持續在數位智慧與實體世界之間交換資訊。

這些互動越分散,連接它們的基礎架構就越重要。

因此,我們相信,未來 AI 技術堆疊與網路技術堆疊之間的界線將越來越難以清楚劃分。

網路當然仍然負責提供連線,但它也會越來越多地參與工作負載放置、路由、韌性保障與系統協同。

網路成為 AI 技術堆疊的一部分,並不是因為網路本身負責完成推論,而是因為:

分散式推論正越來越依賴網路像系統的一部分那樣運作,而不只是存在於系統底層。

從智慧資料流動到智慧網路層

在本系列的第一篇文章中,我們提出了**智慧資料流動(Intelligent Data Movement)**這項新興能力:確保正確的資訊,在正確的時間,透過最合適的路徑,到達正確的位置。

智慧網路層,是這項理念逐步形成架構的一種方式。

智慧資料流動描述的是最終結果,而智慧網路層描述的是實現這項結果所需要的基礎架構能力:持續可視、具備上下文感知的路由、跨分散式環境的編排,以及即時自適應。

我們已經可以看到,這些能力正在產業不同層面獨立出現,包括推論閘道、快取感知路由、分散式模型服務、運算感知型流量導向,以及邊雲協同。

這些技術的名稱未來還會持續演變,整體架構也遠未定型。

但底層的發展方向已經越來越清楚:

當智慧變得越來越分散,連接這些智慧的基礎架構,也必須更加理解應用本身,以及不斷變化的網路環境。

展望未來

十多年來,Caton 一直在關鍵任務級即時媒體領域,解決一個高度專業化但本質相似的問題。

即時媒體對網路提出了非常特殊的要求:大量資料必須持續透過不可預測的公共網際網路進行傳輸,對中斷的容忍度極低,同時營運人員還需要即時掌握網路正在發生什麼。

這些長期需求推動我們不斷發展持續可觀測性、智慧路徑編排、主動流量管理以及高韌性傳輸等能力。

分散式 AI 是一個完全不同的應用領域,但其中一些底層基礎架構問題已經開始顯得非常熟悉。

當多條路徑同時可用時,流量應該如何選擇?系統能多快識別網路效能下降?當某條路徑、某個區域或某個服務供應商出現問題時,通訊能否繼續?網路能否在應用真正受到影響之前就完成調整?

我們相信,隨著 AI 推論持續向雲端、邊緣以及實體世界擴展,這些問題的重要性將持續提升。

未來的網路不會取代模型,也不會取代雲端或邊緣。

但當智慧越來越多地分散在這些環境之間時,網路將逐步成為讓它們能夠作為一個整體協同運作的關鍵基礎架構。

下一代 AI 的能力,不僅取決於智慧在哪裡被計算,也取決於這些運算能夠被多麼智慧地連結起來。