сентябрь 03, 05:39

Google и Meta выпустили конкурирующие модели ИИ с разницей в несколько часов

Google and Meta Released Rival AI Models Hours Apart: Who Leads?

Beincrypto

В среду Google и Meta с разницей в несколько часов выпустили конкурирующие передовые модели ИИ. Google выпустила Gemini 3.8 Flash и вариант для кибербезопасности. Meta выпустила Muse Spark 1.3. Независимое тестирование Artificial Analysis дало Meta преимущество в агентской интеллектуальной работе и научном рассуждении. Google лидировала в фактическом воспроизведении и программировании в терминале. Gemini 3.8 Flash стала третьим выпуском Flash от Google за шесть недель. Модель стоит 0,75 доллара за 1 миллион входных токенов. Стоимость 1 миллиона выходных токенов составляет 3,75 доллара. Вводные тарифы действуют до 31 декабря 2026 года. Затем цена вырастет до 1,50 доллара за 1 миллион входных токенов. Цена выходных токенов затем вырастет до 7,50 доллара за 1 миллион токенов. Google открыла Gemini 3.8 Flash Cyber для доверенных специалистов по защите. Вариант набрал 86,2% в CyberGym и 47,2% в CWE-Bench. Google заявила, что модель создала в 2,6 раза больше корректных исправлений уязвимостей Chrome, чем более крупные коммерческие модели. Fairwind Program ограничивает доступ государственными органами и операторами критической инфраструктуры. Днём ранее OpenAI установила аналогичное ограничение для Astra. Meta выпустила Muse Spark 1.3 через Muse Code и Meta Model API. Инженеры компании измерили примерно на 20% меньше вызовов инструментов по сравнению с версией 1.2. Muse Spark 1.3 в режиме max набрала 1 754 Elo на GDPval-AA v2. Gemini 3.8 Flash в режиме high набрала 1 545 баллов. Muse Spark 1.3 лидировала в тесте банковского агента Sierra Research, набрав 52,4% против 44,9% у Gemini 3.8 Flash. Meta также лидировала в физическом рассуждении CritPt. Gemini 3.8 Flash лидировала в Terminal-Bench 2.1 с результатом 87,6%, в AA-LCR на длинном контексте с результатом 81% и в точности AA-Omniscience с результатом 55%. Gemini 3.8 Flash показала лучший среди протестированных моделей результат в GPQA Diamond — 95%. На Humanity's Last Exam модели завершили тест с разницей менее одного балла. Meta заявила, что максимальный уровень рассуждения Muse Spark 1.3 появится после дальнейшего тестирования безопасности. Вариант xhigh доступен в настоящее время. Он набрал 61 балл в Artificial Analysis Intelligence Index — на четыре балла больше, чем Muse Spark 1.2. Этот результат уступил Claude Fable 5.1 с 66 баллами и Claude Opus 5 с 63 баллами. Илон Маск заявил, что Grok 4.7 появится в ближайшее время.

This content is an AI-generated summary/analysis for informational purposes only and does not constitute investment advice.