цифровые тренды

Gemini 4 официально выпущен, и наконец-то у нас есть передовая модель, где написание кода превосходит программирование

Флагманская модель Gemini, выпуск которой был приостановлен на семь с половиной месяцев, наконец-то получила обновление.

Только что несколько аккаунтов, связанных с Google, одновременно объявили: Gemini 4 Argon официально выпущен.

Кроме того, это, возможно, единственная передовая модель за последнее время, где возможности письма, работы с знаниями и длинными текстами значительно превосходят возможности программирования и работы с агентами.

Всего за три дня даже система именования Gemini 4 изменилась, из-за чего он стал выглядеть почти как модель от OpenAI . Официальное объяснение этому названию минимально; мы знаем лишь, что это внутреннее кодовое имя, использовавшееся на этапе тестирования, и теперь оно применяется в финальной версии.

В буквальном смысле это обозначает элемент 18, аргон, инертный газ, что образует интересную параллель с хромом.

Не спешите тестировать его в приложении Gemini — продолжая популярную в последнее время тему «безопасности», Gemini 4 Argon в настоящее время доступен лишь ограниченному числу партнеров по кибербезопасности в рамках программы Fairwind. В официальном объявлении не указаны сроки полного публичного релиза, лишь говорится, что «он будет доступен сначала платным пользователям API и подписчикам Google AI Ultra». Обычным подписчикам придется подождать еще немного.

Изображение

Ранее в сеть просочилась информация о том, что на тестовом полигоне была обнаружена модель, предположительно предназначенная для Gemini 4, но поскольку официальные лица никогда не заявляли об этом, никто не знает, является ли это настоящая Gemini 4 или же она содержит Fable и Astra, поэтому результаты так называемых сравнительных тестов на самом деле не очень надежны. На данный момент мы можем лишь перечислить данные, опубликованные официальными органами (что также значительно упрощает работу над этой статьей).

По крайней мере, судя по официальным результатам тестов, Gemini 4 Argon обладает чрезвычайно высокой мощностью:

Изображение

Вы всё правильно прочитали. Из 18 перечисленных тестов Gemini 4 показал лучшие результаты в 13 из них.

Наибольшее преимущество демонстрирует Gemini 4 в интеллектуальном анализе. В тестах Vals Finance Agent v2 и Harvey's Legal Agent Benchmark, которые включают реальный финансовый анализ и реальную юридическую работу, можно без преувеличения сказать, что Gemini 4 на два уровня опережает любую другую модель. Это неудивительно — даже в худшие моменты никто никогда не сомневался в интеллектуальных возможностях Gemini.

Изображение

Еще одно традиционное преимущество Gemini — это возможность использования длинных контекстов. В бенчмарке GraphWalks, который проверяет способность эффективно использовать сверхдлинные контексты размером от 256 тыс. до 1 млн., Gemini 4 также превзошла другие флагманские модели более чем на 10%.

Новое преимущество может объяснить эту закономерность.

Изображение

В Gemini 4 Argon лимит вывода токенов увеличен с 64 000 в предыдущем поколении до 1 миллиона. Это означает, что если ваш кошелек это выдержит и Gemini будет стремиться к максимальной производительности, он сможет выводить от 700 000 до 1 миллиона китайских иероглифов за раз, что является грандиозным улучшением для построения цепочки обмена. Официальное объяснение:

Когда модель обладает достаточным пространством для глубокого мышления и генерирует сотни тысяч лексических единиц в рамках одной траектории рассуждения, она выводит рассуждения на совершенно новый уровень глубины, позволяя решать сложные задачи за один раз.

В отличие от этого, производительность Gemini 4 в программировании несколько непостоянна. В DeepSWE v1.1, наиболее часто используемом реальном тесте сборки программного обеспечения с длительным циклом, Gemini 4 показал результат 77,9%, опередив GPT-6 Astra и Claude Opus 5.5 почти на 4 процентных пункта.

Изображение

Однако Gemini 4 демонстрирует низкую производительность в FrontierSWE v2, для решения задач в котором требуется создавать проекты с нуля, а также в Terminal-Bench 4.0, который использует терминалы Linux для выполнения сложных задач.

Характеристики Gemini 4 можно в общих чертах описать следующим образом: Знания/Письмо > Программирование > Терминал.

Независимые экспертизовые исследования также могут подтвердить это заключение.

В анонимном голосовании Arena.ai Gemini 4 показала высокие результаты в Text Arena, заняв первое место благодаря отличной работе со сложными заданиями, следованию инструкциям и креативному письму. Однако в Code Arena: WebDev и Agent Arena, которые больше ориентированы на инженерные навыки, Gemini 4 заняла лишь 8-е место.

Изображение

В некотором смысле, отставание Gemini в возможностях программирования — это скрытое благо. Чрезмерная оптимизация программирования агентов, похоже, сделала многие передовые модели «неестественными», включая повсеместное использование переносов строк, сохранившихся со времен GPT-5.3, и загадочный сленг, появившийся в Opus 4.7. В таких ситуациях модель Gemini, сохраняющая определенное эстетическое чувство языка, несмотря на ограниченные возможности программирования, может решить многие проблемы с написанием текста.

Ещё одним примечательным изменением является значительное снижение частоты галлюцинаций.

Изображение

В тесте искусственного анализа Gemini 4 показал частоту галлюцинаций всего 15%, что является самым низким показателем среди всех передовых моделей. Это означает, что, сталкиваясь с неопределенными ответами, он с большей вероятностью скажет «Я не знаю», чем придумает ответ.

Но для обычных пользователей наиболее важным вопросом, безусловно, является ценообразование, и Google всегда был очень щедр в этом отношении.

Официальная цена API для Gemini 4 Argon составляет 2 доллара за миллион введенных токенов и 10 долларов за миллион выданных токенов, с вероятностью успеха 5% (0,10 доллара). В официальном объявлении говорится, что цена удвоится после первоначального периода скидок при запуске, но, судя по опыту, весьма вероятно, что период скидок не закончится до выхода модели следующего поколения.

Изображение

Исходя из сниженной цены, Gemini 4 стоит в пять раз дешевле, чем GPT-6 Astra и Fable 5.1, и примерно на одном уровне с GPT-6.1 Sol и Sonnet 5.5. Другими словами, при условии отсутствия вводящей в заблуждение рекламы, Gemini 4 в настоящее время является моделью с наилучшим соотношением «интеллекта и цены», предлагая интеллектуальный уровень флагманского класса по цене среднего ценового сегмента.

Выпуск Gemini 4 Argon также положил конец позорной истории: почти полгода преимущества пакета Google AI Pro описывались как «возможность использовать модель 3 Pro»… Учитывая, что даже модели Flash могут превосходить модели Pro после эры Flash 3.5, этот пакет подписки выглядит довольно забавно, поскольку многие покупали его только ради 5 ТБ Google Drive.

Изображение

По крайней мере, теперь Google наконец-то может открыто рекламировать свою программу лояльности.

В этот момент я хотел бы также сказать несколько слов на другую тему.

У каждого есть свой «белый лунный свет» (идеальное устройство), и для меня таким «белым лунным светом» в области ИИ является Gemini 2.5 Pro. В начале прошлого года возможности 2.5 Pro по обработке текста были поистине поразительны, и именно после этого я официально включил ИИ в свой рабочий процесс. Позже, когда я увидел информацию о выходе Gemini 3, я сразу же поделился ею в своих моментах WeChat.

В этом смысле никто не хочет, чтобы Gemini 4 выделялся больше, чем я.

Изображение

Это фантазия поклонника знака Близнецы.

Однако мы все же должны уважать объективные законы. Как многие отмечали, крупномасштабное производство, в конечном счете, является разновидностью обрабатывающей промышленности, подобно производству мобильных телефонов и микросхем. Мы не можем ожидать, что модель, которая долгое время не обновлялась, внезапно займет доминирующее положение на рынке; это так же нереалистично, как если бы завод по производству микросхем, застрявший на 10-нм техпроцессе, вдруг начал выпускать 2-нм чипы.

Значительное расхождение между результатами бенчмарка Gemini 3.8 Flash и реальной производительностью говорит о том, что Google, возможно, внедрила некоторые «специальные оптимизации» для завышения результатов бенчмарков в попытке скрыть свой провал. Аналогично, весьма сомнительно, достигает ли Gemini 4 уровня самых современных технологий (SOTA) в большинстве бенчмарк-тестов.

Практически одновременно с анонсом Gemini 4 агентство Bloomberg сообщило, что сотрудники Google скептически относятся к реальной производительности Gemini 4. Они ссылались на «инсайдеров», которые утверждали, что Gemini 4 плохо справляется с реальными задачами и «испытывает трудности с выполнением некоторых задач программирования».

Изображение

Хотя Google быстро опровергла эти утверждения, и некоторые сотрудники заявили, что Gemini 4 довольно хорош, мы, вероятно, можем поверить, что Gemini 4, который в итоге до нас дойдёт, не будет таким мощным, как показывают результаты бенчмарков. Более того, времени, необходимого для внедрения Gemini 4, достаточно для того, чтобы ChatGPT и модель Claude прошли через несколько итераций по разработке новой версии.

В любом случае, есть и положительные моменты: выпуск Gemini 4 Argon означает, что Google наконец-то вернулся к конкуренции.

Его верхний предел может быть не очень высоким, но нижний предел все еще может быть гарантирован. Следующий шаг – это постепенное наверстывание упущенного с помощью методов крупномасштабного моделирования.