九月 03, 05:39
Google與Meta相隔數小時發布競爭性人工智慧模型
Google and Meta Released Rival AI Models Hours Apart: Who Leads?
Beincrypto
Google與Meta週三相隔數小時發布競爭性的前沿人工智慧模型。Google發布Gemini 3.8 Flash及其網路安全版本,Meta發布Muse Spark 1.3。Artificial Analysis的獨立測試顯示,Meta在代理式知識工作與科學推理方面占優,Google則在事實回憶與終端編程方面領先。Gemini 3.8 Flash是Google六週內推出的第三個Flash版本。該模型價格為每100萬個輸入標記0.75美元,每100萬個輸出標記3.75美元。優惠價格持續至2026年12月31日,之後輸入價格將升至每100萬個輸入標記1.50美元,輸出價格將升至每100萬個標記7.50美元。Google已向可信任的防禦人員開放Gemini 3.8 Flash Cyber。該版本在CyberGym得分86.2%,在CWE-Bench得分47.2%。Google表示,與規模更大的商業模型相比,該模型為Chrome漏洞產生的正確修補程式多出2.6倍。Fairwind Program將存取權限限制在政府機關與關鍵基礎設施營運商。OpenAI一天前也對Astra設下類似界線。Meta透過Muse Code與Meta Model API發布Muse Spark 1.3。公司工程師測得其工具呼叫次數比1.2版本少約20%。Muse Spark 1.3在max模式下於GDPval-AA v2取得1,754 Elo,high模式下的Gemini 3.8 Flash得分為1,545。Muse Spark 1.3在Sierra Research銀行代理測試中領先,得分52.4%,Gemini 3.8 Flash得分44.9%。Meta在CritPt物理推理測試中也領先。Gemini 3.8 Flash以87.6%領先Terminal-Bench 2.1,以81%領先AA-LCR長上下文測試,並以55%的準確率領先AA-Omniscience。Gemini 3.8 Flash在受測模型中取得GPQA Diamond最高分,達95%。兩款模型在Humanity's Last Exam的成績相差不到1分。Meta表示,Muse Spark 1.3的max推理能力將在進一步安全測試後推出。xhigh版本目前已可用。該版本在Artificial Analysis Intelligence Index得分61分,比Muse Spark 1.2高4分,但低於得分66分的Claude Fable 5.1及得分63分的Claude Opus 5。伊隆·馬斯克表示,Grok 4.7將很快推出。
This content is an AI-generated summary/analysis for informational purposes only and does not constitute investment advice.