Gate News 訊息,4 月 27 日——Google DeepMind 的資深產品經理、以及 Google AI Studio 的產品負責人 Logan Kilpatrick 表示,在 X 上,每一家正在打造基於 AI 的產品的公司都應建立自己的自訂基準,用以衡量 AI 模型的效能。他將其描述為一種方法,使模型改進能夠「讓貴公司獲益不成比例」,並敦促創辦人與商業領袖「從明天開始。」
多數公司目前依賴公開排行榜來選擇 AI 模型,但這些排行榜衡量的是通用能力,往往與特定商業情境不匹配。Kilpatrick 以一家合約審閱公司為例,該公司最關注的是條款抽取的準確度——而這項能力在公開基準中並不存在,導致無法評估模型在該任務上的表現。自訂基準提供兩項關鍵優勢:第一,它們讓公司能夠針對各次模型更新,評估其在自身商業任務上的表現,並選擇在其實際使用情境中表現最佳的模型,而非整體排名最高的模型;第二,它們讓公司能夠與模型供應商分享這些測試集,從而在與公司業務息息相關的領域推動持續最佳化。
Kilpatrick 指出,像 Zapier 和 Sierra 這樣的公司已在採用這種做法,他表示:「這裡可以創造出很多 alpha。」
免責聲明:本頁面資訊可能來自第三方,不代表 Gate 的觀點或意見。頁面顯示的內容僅供參考,不構成任何財務、投資或法律建議。Gate 對資訊的準確性、完整性不作保證,對因使用本資訊而產生的任何損失不承擔責任。虛擬資產投資屬高風險行為,價格波動劇烈,您可能損失全部投資本金。請充分了解相關風險,並根據自身財務狀況和風險承受能力謹慎決策。具體內容詳見
聲明。
相關文章
SenseNova U1 將影像生成成本削減至 ChatGPT Images 2.0 的 1/10,SenseTime 於 2025 年公布首個獲利上半年
根據近日 CNBC 的一段採訪,商湯科技(SenseTime)聯合創辦人兼首席科學家 Lin Dahua 表示,該公司最新模型 SenseNova U1 在圖像生成能力上落後於 OpenAI 的 GPT Image 2 與 Google 的 Gemini Nano Banana,但成本僅為 ChatGPT Images 2.0 的十分之一。SenseNova U1 是一個
GateNews1分鐘前
資安勒索軟體案件在 2025 年激增 389%,至 7,831 起,Fortinet 報告
根據 Fortinet 的說法,2025 年全球勒索軟體事件的年增幅達 389%,共 7,831 起;駭客犯罪分子利用 AI,並加速對軟體弱點的攻擊。製造業是受攻擊最嚴重的產業,共 1,284 起;其次是商業服務 824 起,以及零售業 682 起。
GateNews17分鐘前
黑石、KKR、EQT 正與 Alphabet 洽談 AI 投資組合交易
根據彭博社,黑石(Blackstone)、KKR 與總部位於瑞典的 EQT 正與 Alphabet 洽談,透過面向整體投資組合的合約,讓其投資的公司能夠使用 Google 的 AI 模型。這些討論屬於非獨家,未必會促成交易。此安排將使 Google 能夠提供更廣泛的
GateNews27分鐘前
芬蘭 AI 實驗室 QuTwo 完成 $29M 種子輪融資,估值為 $380M ;創辦人先前的公司 Silo AI 已以 6.65 億美元出售給 AMD
根據 Beating,芬蘭 AI 實驗室 QuTwo 完成了一輪 2,500 萬歐元(約 2,900 萬美元)的種子輪融資,融資後估值為 3.25 億歐元(約 3.8 億美元)。創辦人兼執行董事長 Peter Sarlin 先前創立了 Silo AI,該公司於 2024 年被 AMD 以 6.65 億美元收購。
GateNews57分鐘前
DeepSeek 估值為 $45B ,中國國家半導體基金意欲領投
根據 ChainCatcher 報導,中國由國家支持的半導體投資基金正在洽談以領投 DeepSeek 的 A 輪融資,可能將該 AI 實驗室估值約 450 億美元。據四位熟悉此事的人士透露,融資談判仍在進行中
GateNews1小時前
微軟調查:僅 13% 企業獎勵 AI 驅動職場創新失敗的員工
根據微軟於 5 月 5 日發布的年度《工作趨勢指數》報告,該報告分析了數兆筆匿名 Microsoft 365 生產力訊號,並對美國、英國、印度及日本等多個市場的 20,000 名員工進行調查。報告數據顯示,僅 13% 的員工表示在嘗試以 AI 改善工作未獲預期成效時雇主會給予獎勵。
Market Whisper2小時前