Gemini 4 Argon находит критическую уязвимость, которую пропустили прежние модели

Google представила фронтир-модель Gemini 4 Argon, способную удерживать длинные цепочки рассуждений в сложных задачах — от миграции C/C++ на Rust до киберзащиты. Лимит вывода увеличен до 1 млн токенов, а на DeepSWE v1.1 модель показала 77,9%. В ходе раннего тестирования Argon выявила критическую уязвимость в медицинском ПО, которую не заметили предыдущие фронтир-модели.
Модель обнаружила критическую уязвимость, раскрывающую конфиденциальные персональные данные в медицинском ПО, используемом больницами по всему миру, — серьезный риск, который пропустили предыдущие фронтир-модели.
- taylorfinley
Десять дней назад у меня был опыт с Gemini 3.8 flash, который заставил меня задуматься, не перенаправляют ли меня на другую модель для тестирования. Я пытался использовать rocm с llama.cpp на моём 128gb Strix Halo, но смог заставить работать только Vulkan. Я вставил сообщение об ошибке в agy, и он принялся подключать GDB к моему драйверу GPU, реверс-инжинирить интерфейс ioctl очереди ядра и написал C-шим LD_PRELOAD, чтобы заставить ROCm llama.cpp работать на моём Strix Halo. У меня челюсть отвисла всё это время.
Редактировать, чтобы добавить исправление: https://gist.github.com/birep/6f2c8d490c7a29820997d57bd654c3...
- nickysielicki
Важный вывод здесь: скачки, которые мы наблюдали в этом году, похоже, не временное явление. Известная теория Дарио Амодеи заключалась в том, что ИИ — это область, где победитель получает всё, и первая команда, получившая преимущество, никогда не уступит позиции. Термин, который ему нравился, был «концентрация». Это ещё одна точка данных, что он ошибался. ИИ, похоже, более распределён среди неоклаудов и традиционных гиперскейлеров, FAANG и стартапов, GPU и ASIC, чем год назад.
Ни у кого нет рва.
- babelfish
> Мы продолжим собирать отзывы от ранних тестировщиков, пока дорабатываем ограничения, прежде чем сделать Argon доступным для разработчиков, предприятий и потребителей как можно скорее.
Gemini не опровергает обвинения в «неспособности выпустить модель»
- tazjin
> Агенты Argon работают над миграцией кодовых баз C/C++ на Rust по всему Google
Блин, я помню те времена, когда команда cppnext отказывалась даже рассматривать Rust, вместо этого изучая абсурдные вещи вроде Carbon и Swift (!), хотя половина инженерного состава уже знала, к чему всё идёт. Надеюсь, они хотя бы получили несколько хороших повышений за задержки.
- uvdn7
> Крупномасштабные миграции и оптимизации кодовых баз: агенты Argon работают над миграцией кодовых баз C/C++ на Rust по всему Google — масштабируясь от десятков тысяч строк в основных библиотеках, таких как re2, libgav1, до 800K+ строк для ядра Fuchsia OS Zircon.
Для меня это гораздо значительнее, чем другие случайные AI-переписывания c++ на rust. Если они смогут провернуть это с основными библиотеками C++ массово, я не знаю, будет ли C++ всё ещё актуален через несколько лет.
С нетерпением жду поста от google об этих усилиях.
- juanre
Каким бы ни был ваш рабочий процесс, убедитесь, что модель и провайдер заменяемы. Передовые лаборатории будут продолжать обгонять друг друга, как они делали это месяцами.
Чтобы преимущества ИИ были распределены, интеллект должен стать товаром.
Пока вы контролируете навыки, знания и настройку инфраструктуры, всё будет хорошо.
- Revanche1367
Отлично, значит, они _наконец_ решили добавить не-flash модель, и она недоступна для обычных подписчиков на неопределённый срок. В чём смысл платить за план AI Ultra? Anthropic делает то же самое с Fable, насколько я знаю, OpenAI хотя бы позволяет подписчикам Pro использовать Astra. Я подписан на Gemini AI Ultra и ChatGPT Pro, и имею корпоративный доступ к Claude на работе. Честно говоря, flash-модели Gemini, по крайней мере с 3.6, были довольно полезны для несложной работы, но для любой задачи с небольшой сложностью мне приходилось проверять и перепроверять работу несколько раз самому или иногда с другой LLM, чтобы заставить её точно следовать планам. Разочаровывает видеть, что очередной релиз Gemini игнорирует добавление новых pro-моделей.
Редактировать: похоже, я ошибался насчёт ограничения Anthropic на Fable, видимо, наш корпоративный план не включает её. Но блокировка от Anthropic относительно Mythos для обычных подписчиков/корпоративных пользователей, я думаю, всё ещё верна.
- wg0
Срочная новость — не модель. Срочная новость в том, что внутри Google её активно используют на больших кодовых базах для написания кода, и она уже мигрирует 800 тыс. строк кода C++ на Rust.
В этой области любая другая компания, которую я уважаю, кроме DeepSeek, — это Google. Они были честны с самого начала, включая их пресловутую записку «у нас нет рва».
У этой компании огромные данные, собственное железо (TPU) и собственные эксперты. Вообще-то, LLM изобрели здесь.
Хорошее пополнение арсенала.
- gopalv
> принимая тщательные меры предосторожности против передачи результатов обратно в обучение, чтобы не рисковать формированием рассуждений Argon в обход нашего мониторинга. Мы настоятельно призываем остальную индустрию сохранять прозрачность рассуждений в эти ключевые моменты роста возможностей, одновременно управляя рисками согласования, чтобы мысли модели оставались полезными для выявления и диагностики рассогласования.
Это хорошо, но из-за этого самого они и медлительны.
Google наказывают за то, что не позволяют моделям войти в эхо-камеру и ускориться быстрее, чем это возможно для человека.
- mridulmalpani
Интересно, почему Google не делает Gemini моделью с открытыми весами?
Учитывая, что Gemini 4 находится в одной лиге с SOTA-моделями, просто откройте исходники и убейте любую конкуренцию от openAI и Anthropic, и станьте лидером рынка.
Это будет так хорошо во многих измерениях — выиграть время для Google, чтобы доработать следующую модель, лучше для всех таких людей, как мы, убить финансирование или уничтожить оценку конкурентов и заставить их открыть свои модели или заставить создать гораздо более превосходную модель, чем открытый Gemini.
Единственный минус — потеря дохода от Gemini API, который, я не уверен, действительно значителен по сравнению с другими источниками дохода Google, и часть этого может быть компенсирована GCP, так как модель нужно где-то хостить.