自建 AI Gateway 分流並發布電信模型 OTel 2.0,部分應用成本降低 80% 至 90%
AT&T 每天處理 450 億詞元。他們自建 AI Gateway,替每項任務挑選最划算的模型,並發布自研電信模型 OTel 2.0,部分應用成本降低 80% 至 90%。
編譯/Frances‧校訂/CIO 編輯室
AT&T 與 Verizon、T-Mobile 並列美國電信市場三大業者[1],AT&T 負責 AI 業務的副總裁 Mark Austin 掌管約 10 萬名員工的 AI 使用。AT&T 內部 AI 助理 Ask AT&T 於 2023 年上線時,系統全數建構於透過 Microsoft Azure 採購的 OpenAI 模型[2]。三年後,這個平台每天處理的詞元量增加到 450 億,AT&T 也改變了模型的採購與分配方式。
AT&T 每日詞元用量增至 450 億
2026 年初,AT&T 重構 AI 編排層後,每日詞元用量在數月內從 80 億增加到 270 億[3]。AT&T 首席資料暨 AI 長 Andy Markus 在 7 月指出,這個數字已來到每日平均 450 億[4]。AT&T 技術長 Jeremy Legg 在 AMD Advancing AI 大會的主題演講中表示,AT&T 每月消耗的詞元已超過 1 兆,而且用量仍在快速增加[5]。
開源模型落後 6 至 10 個月,夠用嗎?
AT&T 轉向開放模型有兩個目的:控制成本,以及保有自有資料流向的掌控權[6]。Markus 說明了成本壓力的來源:許多人習慣預設使用最新、最強的模型,但 AT&T 執行的任務中,只有一小部分真正需要這種等級的能力,其餘多數改用低成本模型處理,效能並不會因此打折[4]。
Austin 表示,AT&T 發現開源模型的表現已與 Anthropic、OpenAI 較舊版本的前沿封閉模型相當,部分任務甚至更好;他也坦承,開源模型仍落後前沿封閉模型 6 至 10 個月,但差距正在縮小[2]。
挑選開放模型時,Markus 以準確度為首要標準:「我們用冠軍測挑戰者,再用挑戰者測冠軍,每一種都測。」AT&T 以電信資料客製的開放模型 OTel,就曾做過 32 種模型類型與參數規模的組合測試[6]。
AI Gateway 分流,OTel 2.0 補準確度
Markus 把 AT&T 的做法歸納為兩條路徑:用專有的快取感知路由器,替每項任務挑選最划算的模型;以及訓練更多開源模型,滿足電信業務對準確度的要求[4]。這套路由器稱為 AI Gateway,每一輪對話都會權衡速度、成本與預期品質,再決定由哪個模型回應。員工使用的 Ask AT&T 則用開源路由工具 LiteLLM 分流。程式碼摘要一般是指讓模型讀取既有程式碼,再以文字說明程式的功能與邏輯。Austin 表示,這類運算量較低的工作交給 Nemotron、Llama、Gemma 等開放模型;需要從頭撰寫程式碼的程式碼生成,仍由 Claude 與 GPT 負責[2]。
[ 加入 CIO Taiwan 官方 LINE 、 Facebook 與 LinkedIn,與全球CIO同步獲取精華見解 ]
第二條路徑是電信專屬模型 OTel 2.0。GSMA(全球行動通訊系統協會)於 2026 年 3 月在世界行動通訊大會(MWC)發起 Open Telco AI 倡議,AT&T 與美國晶片供應商 AMD 為創始夥伴[7],OTel 2.0 即在這項倡議下開發,7 月 23 日於 AMD Advancing AI 大會發表[5]。OTel 2.0 以 Google DeepMind 的多模態開放模型 Gemma 4 31B-IT 為基底,參數量 310 億,遠小於前沿模型[8]。Markus 表示,這類模型能依任務在規模合適的硬體上執行,地端或雲端皆可[4]。訓練階段,AT&T 處理了逾 1 兆詞元的資料,包含 GSMA 提供的電信文件與 AI 生成的合成資料,再從中篩出約 4,000 億詞元進行後訓練[9]。
硬體方面,AT&T 透過 Microsoft Foundry 動用約 530 顆 GPU 進行雲端訓練,其中約 430 顆為 AMD Instinct MI300X[9]。正式上線後的地端推論,由戴爾(Dell)提供搭載 AMD Instinct MI355X 的伺服器。OTel 2.0 的模型權重公開於開源社群平台 Hugging Face,外界可自行重現評測結果[10],目前位居 GSMA Open Telco AI 排行榜首位[8]。
AI Gateway 帶來的節省,需要複雜的工程與快取設計支撐,規模較小的電信商直接採用 OTel 2.0,用量仍未必足以換得相同的經濟效益[10]。至於中國開發的開源模型,AT&T 研究過但目前不採用,仍以 Google 的 Gemma 與 Meta 的 Llama 為主[11]。
從 20% 到 40%,開放模型接手更多工作
開放模型在 AT&T AI 用量中的占比,5 月為 20%,9 月已達 40%,Markus 預估未來幾個月可能達到 60%[11],最終希望開放模型能承擔 70% 至 80% 的 AI 用量[6]。
Markus 表示,部分應用從封閉專有模型改用開放模型後,成本已降低 80% 至 90%[6]。Austin 則提到,經 LiteLLM 分流後,程式碼相關工作的成本最多降低 56%,輸出品質只下降 2%[2]。AT&T 的 AI 專案也已創造當年度 5 倍的投資報酬率[6]。
Markus 把這套做法歸入他所稱的 ModaaS(模型即服務):從管控自有資料流向可信任的來源,到壓低大規模執行 AI 的成本,全程由企業自己掌握。他把公式寫成「AI Gateway+專屬模型+治理+安全」,認為四者結合,才能走向真正的主權 AI[4]。
Legg 談到資料主權:「我們非常重視資料主權。對我們而言,資料主權代表不被綁定在特定晶片組、特定模型或特定的開發工具組上。」他也提到,AT&T 已開始重建整套內部工作流程,改由 AI 代理執行,新進員工的到職流程就是其中之一[12]。
這樣的走向與產業調查相反。創投公司 Menlo Ventures 的企業生成式 AI 調查指出,企業採用開源模型的比例從 19% 降至 11%[13]。AT&T 每日處理數百億詞元,這個用量規模,可能正是開源路由對 AT&T 划算的原因之一。
Markus 說:「你會聽到『詞元末日』的說法。我們並不害怕詞元的未來,這是我們認為可以掌控的事。」[6]
詞元價格三個月跌一半,但AI 代理成本估漲 5 倍
詞元單價一路下探,企業的 AI 推論支出會跟著下降嗎?
美國研究公司 Silicon Data 編製的「LLM 詞元支出指數」,追蹤企業與開發者實際支付的詞元價格。這項指數在 2026 年 5 月 31 日為每百萬詞元 2.04 美元,8 月 31 日跌至 0.97 美元,是 2025 年底推出以來首度跌破 1 美元,三個月內跌掉一半以上[14]。從成本端看,高盛(Goldman Sachs)預估,半導體供應商透過晶片與架構改良,每年可讓每詞元的推論成本再降 60% 至 70%[15]。供應商降價之外,企業自己也有調降空間。IDC 研究指出,把工作負載導向規模合適的模型,每詞元成本可降低 30% 至 60%,而且不需添購新硬體[16]。
Gartner 研究預估,詞元單價到 2030 年將再下跌 95%,AI 代理工作流程的推論成本到 2028 年卻會成長 5 倍以上,單價與支出走向相反(Gartner 稱為 inference paradox,推論悖論)。成本上升來自兩項因素:一是用量增加,AI 代理處理同等任務所需的詞元,是基礎聊天機器人的 5 至 30 倍;二是任務結構改變,規劃與學習類任務的每詞元供應商成本,是基礎工作流程的 8 至 10 倍。Gartner 也指出,不少買方以為詞元越來越便宜,自家的 AI 支出也會跟著下降,但這項預期將會落空[17]。
AT&T 的用量走勢與 Gartner 描述的情況相符,每日詞元用量從 2026 年 2 月的 270 億,增加到 7 月的 450 億。AT&T 的 AI Gateway 依任務挑選最划算的模型,與 Gartner 建議的分級路由做法一致:把查詢導向成本效益最高的模型,簡單任務不預設呼叫前沿模型[17]。對資訊長而言,單價下跌的好處能留下多少,取決於企業是否有能力替每項任務分配合適的模型。
參考來源
[1] Yahoo Finance,2026 年第一季美國電信業財報分析。
[2] The Information,Mark Austin 專訪;經 BigGo Finance(2026 年 8 月 21 日)、AI Weekly(2026 年 9 月 4 日)轉引。56% 數據另見 Codingscape,〈LLM model routing: Uber, AT&T, and Ramp cut AI costs 30–56%〉。
[3] VentureBeat,Taryn Plumb,〈8 billion tokens a day forced AT&T to rethink AI orchestration — and cut costs by 90%〉,2026 年 2 月 26 日。
[4] AT&T Blog,Andy Markus,〈The Tokenomics Equation: Balancing Cost and Performance〉,2026 年 7 月 23 日。另見 Computer Weekly,Joe O'Halloran,〈AT&T unveils telco open AI model〉,2026 年 7 月 27 日;Mobile World Live,Michael Robuck,〈Analysis: AT&T bets on routing, open model to tame AI costs〉,2026 年 7 月 28 日。
[5] SDxCentral,Ben Wodecki,〈AT&T processes 1T+ tokens using open AI telco model on AMD hardware〉,2026 年 7 月 23 日。
[6] The Wall Street Journal CIO Journal,Belle Lin,〈AT&T Doesn't Fear the 'Token Future'〉,2026 年 8 月 12 日。
[7] Light Reading,Tereza Krásová,〈GSMA launches Open Telco AI initiative with AT&T, AMD as founding partners〉,2026 年 3 月 2 日。
[8] Computer Weekly,Joe O'Halloran,〈AT&T unveils telco open AI model〉,2026 年 7 月 27 日(引述 GSMA 部落格)。
[9] Microsoft Azure Blog,Steve Sweetman,〈AT&T and Microsoft scale trillion-token workloads with Microsoft Foundry and AMD〉,2026 年 7 月 23 日。
[10] RCR Wireless,Christian de Looper,〈AT&T takes OTel 2.0 into production〉,2026 年 8 月 28 日。
[11] The New York Times,Eli Tan,2026 年 9 月 4 日;經 dev.to 轉引。
[12] Telecoms Magazine,Sam Fenwick,〈AI for Telcos: AMD, AT&T and Microsoft Announce OTel 2.0〉,2026 年 7 月 24 日。代理化工作流程另見 SDxCentral,2026 年 7 月 23 日。
[13] Menlo Ventures,《2025: The State of Generative AI in the Enterprise》,2025 年 12 月 9 日。
[14] Silicon Data,LLM Token Expenditure Index(彭博代碼 SDLLMTK);5 月數據經 Jefferies 研究報告(《南華早報》2026 年 8 月 10 日報導),8 月數據經 CNBC 2026 年 9 月 1 日報導。
[15] Goldman Sachs Research;經 eeNews Europe 2026 年 5 月 28 日報導。
[16] IDC,Ryan Smith,〈The Token Is the New Budget Line〉,2026 年 9 月 10 日。
[17] Gartner,分析師 Will Sommer、Sabine Zimmerhansl 研究報告;經 Computerworld 2026 年 8 月 17 日報導。
(本文授權非營利轉載,請註明出處:CIO Taiwan)














