OpenRouter 多模型時代的 AI 推理入口

OpenRouter 看起來只是一個統一調用 AI 模型的 API,它真正建立的是模型、Inference Providers、價格、路由與開發者之間的市場 從 Alex Atallah 2023 年的第一個問題開始,理解這家公司為什麼在多模型時代變得重要

OpenRouter 多模型時代的 AI 推理入口

2026-07-23 WSJThe Information 報導傳出 Stripe 正和 OpenRouter 洽談 100 億美元收購,儘管尚未確定,但確實引起關注,更多人的疑問是,這個 AI 中間件 ( AI Gateway ) 有什麼價值、它只是一個中轉站嗎

看了 Alex 從 2025 年到最新的訪談,Alex 在 2025 年 AI Engineer 辦的活動 World's Fair 這場分享,是最適合理解 OpenRouter 經歷階段、願景和發展方向,讓你對 OpenRouterAlex Atallah 有更深一層的認識


Fun stories from building OpenRouter and where all this is going - Alex Atallah, OpenRouter - AI Engineer

Will this market be winner take all?

Alex Atallah 在 2023 年初開始創立 OpenRouter 時,它嘗試回答一個問題:Will this market be winner-takes-all?

在 2022 年的時候他看到了 ChatGPT,然後 Alex 就對 AI 上癮了 ( I got bitten by the AI bug ) 並嘗試回答這個問題,既然已知 Inference 市場可能是 Software 最大的市場、而贏家將拿下這個市場

所有人都默認是肯定的,且 OpenAI 在當時是遙遙領先的模型

只有少數幾個對手在後面苦苦追趕。Alex 自己動手寫了幾個原型專案,想探索這些模型能用來做什麼,同時也想深入研究開源模型

Will it be winner-take-all?

單一模型的弊端 : 審查政策與灰色地帶

2023 年一月有人開始意識到第一個跡象,第一個證據是 Moderation ( 審查機制 )

用戶截圖收到在 Reddit 上反應,收到被 OpenAI 終止服務的通知

留言表示 OpenAI 限制了特定的使用方式,例如 D&D ( 龍與底下城 )、文字冒險、角色扮演、科幻小說等場景,人們希望能夠不要被平臺綁定,開始尋找有明確審查機制的平台,目的不會因為其公司的審查機制而受限使用

January, 2023: Moderation

比如說,我們看到有人在 AI 寫一部偵探小說,到第四章時,主角偵探發現某人犯下謀殺案並對受害者開槍

OpenAI at the time sometimes refused to generate that output or it was like questionably against the terms of service

那個時候 OpenAI 有時候就會直接拒絕生成這樣的內容,因為認為可能違反了他們的服務條款

And of course we saw role play and basically a big gray area emerge around what models were willing to generate.

當然,我們也看到了 Roleplay 應用的興起,然後基本上圍繞著「模型願意生成哪些內容 」這件事情,出現了非常大的灰色地帶

February, 2023: ... and Llama wins, almost

接著在 2023 年的 2 月,他們看到了 LLaMA 跟幾個開源模型的更新。LLaMA 是一個最早由 Meta 開源的模型,在論文中提到它在大多數的基準測試中超越了 GPT-3,這讓所有人大為震驚

這是一個非常大的事:一個開源模型居然比 GPT-3 還強,而且它的參數還只是 130 億的小參數模型,可以在任何 laptop 上面運行,效能卻擊敗了那些在 hyperscaler 或耗費巨資才能運行的 closed model

Alex 也表示說,LLaMA 的出現掀起了巨大的狂潮,但他也坦白,那個時候還不怎麼好用。而且因為當時的基礎設施不成熟,要在本地運行 Llama,其實是一件非常困難的事

March, 2023: The first distillation success

接著在 2023 年 3 月,我們迎來了歷史性的一刻,也就是語言模型長尾生態(Long tail of language model)誕生最大的瞬間:第一個成功蒸餾 GPT-3 的模型 Alpaca 出現了

它來自於一群 Stanford 大學的研究人員,拿著 LLaMA-1,用 GPT-3 跑出一大堆合成輸出,再用這些輸出 Fine-tune LLaMA-1(based on the output)建立了 Alpaca,而且花費少於 600 美金

這是 Alex 第一次親眼見證到一個大模型的 style and knowledge(對話風格和知識)可以被直接轉移到一個小模型身上

這個模型蒸餾的發現徹底解放了這個市場,意味著你不需要 1,000 萬美元的預算就能打造出自己的模型,甚至能首度將獨家數據以語言模型服務的形式進行商業化

基於特定模型去 train your own model 這件事情是可能的

there's going to be tens of thousands of these

Alex 立刻開始聯想到,未來肯定會出現成千上萬、甚至數十萬這樣的新模型,這會極度重要。這象徵著人類的知識能夠被蒸餾進軟體之中,而我們現在需要一個地方,讓人們去發現這些模型,並且理解它們各自的功能

Timeless 訪談 Alex 提到 Hugging face 在當時是比較接近這個願景和問題的平台,但還很難使用

因為即使是開源權重的模型(也就是 open weight model),它本質上也是封閉的。它事實上就是一個黑盒子,你拿到的只是幾十億個 floating point numbers,然後你不知道它擅長什麼,也不知道能用它來做什麼

April, 2023 Window AI

就在 4 月,也就是 Alpaca launch 的下個月,他推出了 Window AI,這是一個開源的 Chrome extension,它能夠讓用戶自由選擇模型

Timeless 的訪談中也描述到,這個 Window AI 的起點 ( 也就是 OpenRouter 概念前身 ),描述操作很像加密貨幣的 Web3 錢包,不過裡面裝的是 AI 模型,目的是在於讓所有人能夠構建和不受模型限制的應用

這是一個開源的 Chrome 擴充功能,基於 Plasmo 框架開發 ( Louis 是該開發套件的創辦人 )能讓使用者自由選擇模型,並讓網頁應用程式直接串接使用。它能直接在網頁內部,無縫替換掉原本預設的 OpenAI 服務

Window AI - Github

就在 2023 年 5 月,OpenRouter 正式發布了

在他開發了 Window AI 之後,和 Louis 一起創辦了 OpenRouter 這家公司

一開始只想 把所有模型聚集在同一地方,並且幫大家搞清楚這些模型能夠做什麼

May, 2023: OpenRouter

它現在成長為一個能夠提供更優價格與可用性,且無需定位訂閱、按 token 計費的平臺。它能為你的 software 提供服務,或是幫你 figure out 哪一個 intelligence 的調度是最優解、最適合

What is OpenRouter

那麼,OpenRouter 是怎麼走到這一步的?

讓我們稍微聊一下它到底是什麼,因為今天在座的各位可能不是每個人都對 OpenRouter 很熟悉。在過去這兩年裡,我們每個月都保持著 10% 到 100% 的月增長率(MoM)OpenRouter 是一個讓能你獲取所有語言模型的 API

10 to 100% growth MoM for the last 2y

同時,它也成了某種指標性的數據中心,讓人們能看到誰正在使用哪款模型、以及這些趨勢隨著時間推移是如何變化的,而這些數據你都可以在我們公開的排行榜(rankings)頁面上直接看到

這是一個單一的 API,你只需要付費一次,就能以近乎為零的切換成本在不同的模型之間穿梭。OpenRouter 現在有大約 400 多個模型 ( 2025 年、最新 2026 年平台數據是 500+ 模型 ) ,以及超過 60 家活躍的運行商(providers)

2025 user data

而且你可以使用許多不同的支付方式來購買,包括加密貨幣。我們基本上幫你處理了所有繁瑣的底層工作,包括工具調用(tool calls)的標準化與快取(caching)好讓你用最划算的價格,存取最完整的功能,而不需要自己去煩惱運行商到底支持哪些特性

而最初 OpenRouter 其實並不是一個 Marketplace

它當時就只是一個收集所有模型的地方,並提供一個管道讓大家探索是誰在用哪些模型

Providers

一開始,當第一批開源模型出現時,OpenRouter 針對每個模型大概只接了一到兩個運行商

當時只有一個主運行商 ( Primary provider ) 和一個備用運行商 ( fallback provider ) 最早期就是這樣,甚至連運行商 ( Provider ) 這個概念都沒有寫出來

但很快地,事情變得很明顯:未來將會有一大堆公司想要代管、運行這些模型,而且各家的定價和效能天差地別。與此同時,技術特性的數量也開始急劇膨脹

有些運行商支持 min-p 取樣器,但大多數不支持;有些支持 Prompt 快取,有些支持工具調用(tool calling)與結構化輸出(structured outputs),有些則完全不行

一瞬間,整個生態系就這樣膨脹成了一隻完全失控的『異質怪獸(heterogeneous monster)』,而 OpenRouter 唯一想做的,就是馴服這隻怪獸

因此,我們將所有運行商聚合在同一個接口上

因為有了不同的價格點,這裡就演變成了一個市集。你可以看到,像 Llama 3.3 70B instruct 這樣在平台上擁有最多運行商的模型之一,背後就有多達 23 家運行商

Llama 3.3 model provider

閉源模型身上也發生了一些有趣的事,那就是它們有時根本無法應付龐大的市場需求。因此,我們幫助開發者獲得了可用性(uptime)的提升

Closed-source models didn't keep up with demand...

你可以看到,僅僅透過針對單一模型聚合許多不同的運行商,OpenRouter 能為可用性帶來多大的提升。這對不論是使用開源還是閉源模型的開發者來說,都變得非常有幫助,OpenRouter 也因此成為了同時服務這兩者的 Marketplace

So we became a marketplace for both...

OpenRouter 上提供延遲(latency)與吞吐量(throughput)的圖表,並幫助人們利用真實世界的數據,去了解每個模型在實際運作時的延遲與吞吐量表現,OpenRouter 也因此成為了一個 Marketplace

Models on OpenRouter

OpenRouter 是一個特別為語言模型進行深度優化的 marketplace,我認為這非常符合推理服務的需求,畢竟這極可能是軟體史上最大的市場

你顯然還能看到 OpenRouter 支持的其他幾項功能:像在 iMessage 上傳簡訊一樣輕鬆輸入你自己的 prompt,比較模型回復

Compare models against your own prompts
Data about how you using models

OpenRouter 提供細粒度的隱私控制,支持 API 級別的覆蓋設定(overrides),並能讓用戶在同一個地方查看所有模型的使用情況,享有極佳的可觀測性(observability)

Multimodel

回到我們最一開始的問題,亦即 智能(intelligence)市場是否會是贏家全拿?我想現在得到了一個最可能押對的賭注:事實並非如此

Will intelligence be winner-take-all

這是 OpenRouter 按模型創作者(author)分類的數據,顯示了每家模型處理的 token 總量

你可以看到 Google Gemini 起初市佔非常低,2024 年 6 月大約只有 2% 到 3%,但在過去這 12 個月裡非常平穩地成長,2025 年已經達到 34% 至 35%

Anthropic 則是 OpenRouter 平台上最受歡迎的模型之一

而 OpenAI 在這份數據中稍微被低估了,因為許多開發者使用 OpenRouter 是為了在其他模型上獲得「 類似 OpenAI 」的調用行為,但即便如此,OpenAI 在這裡的份額也成長得非常多

2026 - Model market Share

所以,在聽完我剛才分享的所有背景故事後,這就是 OpenRouter 對這個市場的信念

What we believe ( OpenRouter )

未來絕對是 多模型(multi-model)的天下

OpenRouter 的所有客戶中,有極大比例的客戶會將不同的模型用於不同的用途,並意識到這樣做可以釋放出極其巨大的優勢與收益

Inference 推理服務本身也是一種大宗商品(commodity)

OpenRouter 希望讓來自 AWS Bedrock 的 Claude,在使用起來時跟來自 Google Vertex 的 Claude 感覺完全一模一樣

OpenRouter 之所以這麼做,是因為這兩家超大規模雲端巨頭(hyperscalers)本質上是在以不同的費率和效能,遞送一模一樣的商品

2026 Weekly active models

而對於開發者來說,你只想能夠直接挑選,而不需要去煩惱到底是誰在背後提供服務

OpenRouter 認為推理服務將成為企業最主要的營運支出(operating expense)因此,模型的挑選與路由調度(routing)將會至關重要

你可以看到 OpenRouter 上的活躍模型數量正在持續穩步增加

使用者並不會只是盲目地在各個模型之間跳來跳去,使用習慣其實往往具有黏性(sticky)。而身為開發者,OpenRouter 正在努力讓這個狂野的生態系變得更加標準化(homogeneous)更易於合作開發

Making an increasingly heterogeneous ecosystem homogeneous

Technical challenge: Inference-Native Middleware

為了致敬 Swix 為這場演講訂定的技術標題,OpenRouter 來聊一個技術故事——這是 OpenRouter 在建立公司的過程中所著手解決的

Swix (Shawn "swyx" Wang) 在 2025 年 AI Engineer Summit 發表的演講標題是 Fun stories from building OpenRouter and where all this is going

那就是 OpenRouter 自己對於如何在 OpenRouter 內部實現模型上下文協議(MCP)的想法

Technical challenge: Inference-Native Middleware

雖然 OpenRouter 目前並沒有真正的 MCP,也沒有 MCP 的 marketplace,但 OpenRouter 確實遇到了需要為推理服務擴展新特性與新能力的需求

例如:讓所有模型都支持網頁搜尋、讓所有模型都支持 PDF 解析,以及其他即將推出、非常有趣的延伸功能

註:2026 年 6 月推文中已經展現 OpenRouter 如何回答模型定價和路由問題

OpenRouter MCP, live model intelligence right inside your agent

OpenRouter 真正想做的,是把這些能力賦予給所有的模型

但這不僅僅涉及當前 MCP 所做的前置處理(pre-flight)工作,也就是調用另一個 API、獲取一堆行為,然後在推理過程中隨時調用這些行為

OpenRouter 同樣需要有能力在將輸出結果,傳送回使用者的路上進行轉換(transform)因此,OpenRouter 真正、迫切需要的,是更像 中間件(middleware)的東西

中間件在網頁開發中是一個非常普遍的概念。舉例來說,當用戶在為網頁應用程式設置身份驗證或快取機制時,就會設置中間件

middleware for inference called "Plugins"

因此,OpenRouter 開發了一種可以說是 AI 原生(AI-native)且專為推理服務優化的中間件。它的結構和運作方式,與 Next.js 或一般網頁開發中的中間件(middleware)並沒有太大的不同

Unlike MCPs, plugins allow transformations on both inputs and outputs

螢幕上的代碼,這就是 OpenRouter 插件系統的大致樣貌。它可以在插件內部調用 MCP,但更重要的是,它能在結果返回給使用者的途中對其進行增強(augment)

這是一個 OpenRouter 網頁搜尋插件的例子,它能賦予「任何」語言模型網頁搜尋的能力。每個語言模型都可以接入這個插件,並在結果即時返回給使用者的同時,在串流中嵌入網頁標註。這一切都是在串流中即時完成的

所以不需要強求一次拿取所有的 token,它能在串流(stream)傳輸時即時發生

在建立 OpenRouter 的過程中,OpenRouter 也解決了許多其他非常棘手的問題

tricky problems

OpenRouter 非常追求極致的低延遲,最後藉由大量的自定義快取優化工作,OpenRouter 成功將路由延遲壓到了 30 毫秒左右—相信這是業界最頂尖的表現

OpenRouter 還需要讓串流(streams)變得可以被取消。所有這些不同的運行商,在串流取消政策上都有著天差地別的規範

有些時候如果用戶直接斷掉串流,推理供應商依然會向用戶收取整筆對話的費用。有時不會,而有時它們則會對用戶根本沒收到的後續 20 個 token 進行計費

OpenRouter 投入了非常多的精力來理清這些邊緣案例(edge cases),並理解開發者會在哪些時刻特別介意這些細節。將所有這些運行商和模型進行標準化,成了一個龐大且棘手的架構難題,OpenRouter 為此鑽研了很長一段時間

Where this is all going

那麼,這一切在未來會走向何方?OpenRouter 將在 OpenRouter 中加入更多模態(modalities),Alex 認為這也將是整個產業的重大變革。很快就會開始看到 LLM 直接生成圖像

More modalities...

在市場上已經看到了幾個例子,有些人稱之為 Transfusion model(自回歸與擴散混合架構)這是一種將 Transformer 與 Stable Diffusion 混合在一起的技術

這能賦予圖像多得多的世界知識,並讓人們能跟圖像直接展開對話。OpenRouter 認為這對於推動圖像生成產業、讓它真正發揮實用價值來說,是至關重要的

想像一下,我今天剛好遇到一個人,他正在使用這種 Transfusion model ,或者是他告訴我他的客戶正在用這種模型來生成菜單

試著想像,在外送應用程式裡面的整份菜單,全部由融合模型一鍵生成。這在未來的一年裡將會是非常令人興奮、且極具影響力的大事

OpenRouter 也將致力於研發更加強大的路由調度,畢竟路由就是 OpenRouter 的看家本領

geographical routing

因此,OpenRouter 即將推出地理路由(geographical routing)雖然目前這項功能還很陽春,但未來 OpenRouter 將能夠把用戶引導至最合適地點的合適 GPU,並進行企業級的深度優化

Model Providers on openrouters

OpenRouter 也將提供更佳的 prompt 可觀測性,以及更完善的模型發現機制,例如極度細緻的分類系統

用戶能想像直接篩選出「最擅長理解日文輸入並產出 Python 代碼 」的模型嗎?

當然,更劃算的價格也會在 OpenRouter 上推出

補充:2026-07-31 就公佈最新的 ChatGPT-5.6 Terra 模型降價

GPT-5.6 Terra and Luna just got price cuts from OpenAI
Better prompt observability. Better model discoverability/routing.

所以,如你們所知,OpenRouter 深信合作的力量,並致力於打造一個持久、且能將供應商鎖定(vendor lock-in)降到最低的生態系

因此,歡迎與 OpenRouter 展開合作,這是 OpenRouter 的電子郵件,如果你有興趣,也歡迎加入我們的行列。謝謝大家

Ends