開源模型踢館閉源巨頭!Ornith-1.5 實測硬尬 Claude 3.5,9B 版竟能在 iPhone 17 離線跑?

當 OpenAI 與 Anthropic 忙著關起門來遊說政府「管制開源」,DeepReinforce 直接把一顆震撼彈砸進整個 AI 圈。代號 Ornith-1.5 的全新開源模型系列正式亮相,技術白皮書上的數字讓人不得不揉揉眼睛——在 SWE-bench 與極限推理評測中,它的旗艦版本不僅追平 Claude 3.5 Sonnet,甚至在某些項目上踩過了 Opus 4.8。更諷刺的是,那個能在你口袋裡手機離線運行的 9B 輕量版,竟然還是開源的。

這不只是一次產品發布。這是一封戰書。

算力貧瘠時代的終結?開源社群終於等到「破壁者」

過去兩年,開源模型與閉源旗艦之間始終存在一道看不見的天塹。不是開源陣營不夠努力,而是後訓練階段的資料瓶頸與算力落差實在太現實。當 GPT-4 等級的模型在複雜程式碼建構與多步驟推理中游刃有餘時,開源社群多半還在為了「如何用 7B 參數硬撐出 30B 的效果」絞盡腦汁。

但 Ornith-1.5 的出現,某種程度上宣告了這場龜兔賽跑進入新的賽段。根據 DeepReinforce 公布的技術白皮書,這一系列模型從 397B 雲端旗艦到 9B 端側輕量版,全部採用 Apache 2.0 商業友善授權。這意味著企業不僅可以免費下載、修改,還能直接拿去商用,完全不用看任何閉源廠商的臉色

從產業面來看,Apache 2.0 的授權選擇是極具戰略意圖的一步。過去許多開源模型打著「開放」旗號,卻在商用條款上綁手綁腳。DeepReinforce 這招等於直接拆掉了最後一道門檻,讓從新創到大型企業都能毫無顧慮地採用。這不是情懷,這是精準的市場卡位。

自我改進循環:讓 AI 自己跟自己下棋

Ornith-1.5 效能躍升的核心秘密,藏在一個名為「自我改進循環(Self-Improvement Loop)」的訓練機制裡。白話文來說,傳統模型訓練到後期就像一個學生把課本翻爛了,沒有新題目可寫,進步幅度自然趨緩。但 DeepReinforce 的做法,是讓模型在學習過程中自己出題給自己寫,而且越出越難、越寫越深

這套機制的本質,是讓 AI 在無需持續依賴人工標註數據的情況下,自主建構出一個性能提升閉環。模型會主動探索推理邊界、提出更具挑戰性的邏輯任務,再透過強化學習反饋進行迭代校正。聽起來很抽象?用圍棋來比喻,就是 AlphaGo 不再需要人類棋譜,而是自己跟自己下棋,然後突然下出讓人類完全看不懂的 37 手。

從技術層面來說,這解決了開源模型長期以來「靜態資料集訓練」的根本痛點。當閉源廠商靠著海量用戶對話數據不斷強化模型時,開源陣營往往只能仰賴有限的公開資料。自我改進循環的價值在於——它讓模型的進化不再完全取決於外部數據的輸入量,而是靠內部的推理迭代來突破天花板

從 397B 雲端巨獸到口袋裡的 9B:一場精準的產品矩陣布局

如果說自我改進循環是 Ornith-1.5 的「裡子」,那它的產品矩陣布局就是徹底打破市場想像的「面子」。DeepReinforce 一口氣端出三個主力版本,每個都有明確的市場定位與打擊目標:

注意最後一列。Ornith-1.5-9B 以 90 億參數的「小身板」,在標準基準評測中跨級擊敗了 Google 的 Gemma-4-31B。這不是「接近」,是直接越級打怪。參數利用效率的懸殊差距,說明了 DeepReinforce 在架構設計與訓練演算法上的積累,已經不是單純的「堆參數」邏輯可以解釋。

換個角度想,這對企業採購決策會產生很實際的影響。假設你是一家新創的技術長,現在面對兩個選擇:每個月花數萬美元租用閉源 API,或是一次性投入硬體成本、部署一個效能相當甚至更好的開源模型。這道選擇題的答案,接下來幾個月會越來越明顯。

9B-Mobile 量化版:AI 隱私的最後一塊拼圖?

在所有版本中,我最感興趣的反而是最不起眼的那個——Ornith-1.5-9B-Mobile。DeepReinforce 透過 4-bit 權重壓縮、端側 NPU 記憶體佔用優化與頻寬加速技術,把這款模型塞進了 iPhone 17 與 Android 旗艦機的晶片裡。離線、免費、不送數據上雲,三個關鍵字組合在一起,殺傷力極大。

過去企業導入 AI 最大的痛點,始終繞不開資料隱私。銀行業不敢把客戶資料餵給 API、醫療機構不敢用雲端模型處理病歷、法務部門更不可能讓合約內容經過第三方伺服器。Ornith-1.5-9B-Mobile 給出的解方是:既然大家不信任雲端,那我們就把模型搬到你的設備裡,數據從頭到尾不出門。

說實話,端側 AI 不是新概念,Google 的 Gemma 系列、Apple 的端側模型都在做類似的事情。但 Ornith-1.5 的差異在於——它在不犧牲推論品質的前提下,把運行門檻壓到了幾乎任何一台旗艦手機都能負荷的程度。這不只是技術示範,這是直接走進消費者的日常生活。

閉源陣營的噩夢:當開源不再只是「第二選擇」

就在 Ornith-1.5 發布的同一段時間,外媒披露 OpenAI 與 Anthropic 正在密集遊說美國政府,呼籲對中國開源模型實施更嚴格的出口管制。諷刺的是,黃仁勳和馬斯克等人卻公開表態力挺開放生態——這場 AI 霸權的角力,早已超越單純的技術競賽,上升到地緣政治與商業利益的全面對決。

回到技術本身。Ornith-1.5 的出現,真正撼動的是一個根深蒂固的產業預設——「開源等於次等貨」。過去企業選擇閉源模型,不只是因為效能更好,更因為閉源廠商提供了「責任歸屬」的明確窗口。但當開源模型在效能上逐漸追平,甚至部分超越閉源旗艦時,這個預設就開始鬆動了。

DeepReinforce 的布局很聰明。它沒有走 OpenAI 那種「單一巨型模型打天下」的路線,而是用完整的產品矩陣從雲端一路覆蓋到終端設備。397B 打的是品牌旗艦與技術話語權,35B 搶的是企業私有化部署的利潤中心,9B-Mobile 攻的則是隱私敏感型應用與消費端場景。三條戰線同時開打,火力相當集中。

當然,開源生態的挑戰從來不在「發布那一刻」的聲量,而在後續的生態維護與版本迭代。Ornith-1.5 能否在三個月後仍然保持競爭力、社群能否圍繞它建立起完整的工具鏈與應用生態,才是真正決定這場「開源反擊戰」能走多遠的關鍵。

但至少在今天,你可以把這句話記下來:閉源旗艦的護城河,已經被鑿開了一道裂縫

寫在最後:如果你正在評估企業導入 AI 的方案,現在或許是時候重新盤點開源模型的選項了。Ornith-1.5 系列的釋出,不只是一則新聞,它可能直接影響你下一季的技術採購決策與資料治理策略。花一個週末下載 9B 版本在你的開發環境跑一輪,親眼確認它的真實表現——這比看一百篇評測文都更有說服力。

本文改寫整理自公開新聞來源,原始報導由T客邦發布。

常見問題 FAQ

Ornith-1.5 真的能在 iPhone 17 上離線跑嗎?效能會不會打折?

可以。DeepReinforce 專門推出了 9B-Mobile 量化版本,透過 4-bit 權重壓縮與 NPU 優化,在旗艦手機上就能離線執行複雜對話與程式碼輔助,無需連網、無需 API 費用,且推論品質仍維持極高水準。

Ornith-1.5 的 Apache 2.0 授權代表我可以免費商用嗎?

是的。Apache 2.0 是商業友善的開源授權條款,允許企業自由下載、修改、甚至拿來開發商業產品,不需要向 DeepReinforce 支付任何授權費或權利金。

9B 輕量版真的能打贏 Gemma-4-31B?參數差這麼多怎麼可能?

根據 DeepReinforce 公布的基準評測數據,Ornith-1.5-9B 在多數標準測試中確實跨級擊敗了 Gemma-4-31B。這並非神話,而是源於其訓練階段的「自我改進循環」機制與更高效的架構設計,讓參數利用效率遠超傳統稠密模型。

自我改進循環跟一般的 RLHF 有什麼不一樣?

RLHF(基於人類反饋的強化學習)需要大量人工標註數據來提供獎勵信號,而 Ornith-1.5 的自我改進循環是讓模型自主生成更困難的推理任務並自我迭代,大幅降低對人工數據介入的依賴,實現更接近「自主進化」的訓練模式。

現在哪裡可以下載 Ornith-1.5 的模型權重?

DeepReinforce 已將 Ornith-1.5 系列模型全面開源上架,使用者可透過官方 GitHub 頁面與 Hugging Face 平台取得各版本的模型權重與部署文件,建議參照官方技術手冊進行環境配置與效能調校。

※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。

Categories: