Содержание
Google выпустила крупное обновление Gemini 3 Deep Think — «рассуждающего» ИИ-режима, который компания позиционирует как инструмент для науки и инженерии. На бумаге всё выглядит мощно: высокие результаты в бенчмарках, уверенная математика и программирование, плюс отдельный агент для исследовательских задач.
Но есть нюанс, знакомый всем, кто хоть раз пытался «поспорить» с нейросетью: даже в таком продвинутом варианте модель может неверно понять вопрос так, чтобы на него было легче ответить. Разработчики прямо признают — по сравнению с людьми система всё ещё крайне ошибочна, и до замены исследователей ей далеко.
Что именно обновили и кому это доступно
Новая версия Gemini 3 Deep Think создавалась вместе с учёными и заточена под задачи, где часто нет единственного правильного ответа, а данные могут быть неполными или несистематическими. То есть это попытка сделать ИИ не просто «болталкой», а более прикладным инструментом для реальных исследований.
Режим Deep Think появился прямо в приложении Gemini, но воспользоваться им смогут только подписчики Google AI Ultra. Параллельно Google впервые обещает открыть доступ к сервису через API Gemini — но не всем подряд: инженерам, исследователям и компаниям придётся подать заявку.
Важный момент: речь не про «ещё одну модель для чата», а про платформу, которая должна помогать разбирать сложные постановки, где ограничения размыты, а исходные условия могут быть сформулированы неидеально. Именно на таких задачах обычно и ломается большинство ИИ — и именно здесь Google пытается поднять планку.
Результаты бенчмарков: цифры выглядят впечатляюще
Google сопровождает релиз набором метрик, и они действительно звучат громко. В тесте Humanity’s Last Exam Gemini 3 Deep Think набрала 48,4% без использования сторонних инструментов. В бенчмарке ARC-AGI-2 результат составил 84,6%, что в исходном материале описывается как беспрецедентный показатель.
По программированию тоже всё бодро: в задачах Codeforces модель получила рейтинг 3455 Elo. А в задачах Международной математической олимпиады 2025 система показала уровень золотой медали. Тот же уровень, по данным Google, она продемонстрировала на олимпиадных задачах по химии и физике.
Отдельно упоминается CMT-Benchmark, где Deep Think показал высокий уровень владения теоретической физикой, но с результатом 50,5%. Это хороший маркер того, что даже при сильных «витринных» достижениях остаются области, где модель не выглядит всемогущей — особенно если тест ближе к специализированной теории, а не к задачам с узнаваемыми шаблонами.
Aletheia: исследовательский агент на базе Deep Think
Gemini 3 Deep Think стала основой для ИИ-агента, который в Google DeepMind называют Aletheia. Его идея — не просто выдавать ответ, а сопровождать работу механизмами самопроверки: агент включает средство проверки гипотез, изложенных естественным языком, чтобы находить слабые места в предлагаемых решениях.
Работа строится итеративно: генерация решения, критика, корректировка и новый заход. Причём разработчики подчёркивают важную для научной сферы вещь: агент может признать, что не способен дать ответ. Это звучит банально, но на практике именно «неумение остановиться» часто превращает ИИ в фабрику уверенных ошибок.
Для сложных исследований Aletheia подключает поиск Google и инструменты веб-навигации. В описании подчёркивается, что при подготовке сводок по опубликованной литературе агент не выдаёт несуществующих ссылок и старается избегать вычислительных неточностей. Это всё ещё не гарантия идеальной точности, но хотя бы попытка закрыть две классические боли: галлюцинации источников и «поплывшие» расчёты.
Уровни достижений Aletheia разработчики разложили по пяти градациям — от скромных результатов до «знаменательного прорыва». Пока агенту удалось добраться лишь до второго уровня («пригодно для публикации») в разных режимах — автономном, совместной работы с человеком и как вспомогательный инструмент. Третий («значительный прорыв») и четвёртый («знаменательный прорыв») уровни ему пока не покорились.
Где ИИ спотыкается: подгонка задачи под ответ
Самая интересная часть истории — там, где Google честно показывает ограничения. По заданию разработчиков Aletheia проанализировал 700 нерешённых математических задач, сформулированных Палом Эрдёшем. В итоге агент «осилил» 13 задач, но и здесь есть оговорки: для 9 из них уже существовали решения, а действительно впервые решёнными выглядят лишь 4.
Ещё жёстче выглядит статистика по качеству выходных решений. Из 212 решений, которые выдал ИИ, «содержательно правильными» признали лишь 6,5%. Остальные либо имели фундаментальные недостатки (68,5%), либо решали неправильно интерпретированные агентом версии исходных задач (31,5%).
Именно отсюда и формулировка, которая цепляет сильнее любых 84% в бенчмарках: разработчики согласились, что ИИ проявляет склонность неверно понимать вопрос таким образом, чтобы на него было легче ответить. По-человечески это выглядит так: модель как будто «срезает угол» — не всегда осознанно, но системно. А в науке и инженерии такая привычка опаснее, чем просто «ошибка в факте».
Что это значит для пользователей и рынка
Для обычных пользователей новость в первую очередь про доступность: Deep Think теперь в приложении Gemini, но фактически это привилегия подписчиков Google AI Ultra. Для профессионалов важнее другое — обещанный доступ через API. Если Google действительно начнёт пускать исследовательские команды и компании, это может ускорить появление специализированных инструментов: от анализа литературы до автоматизации части рутины в R&D.
Но Google одновременно даёт понять, что «магического учёного в коробке» не получилось. Да, модель может быть сильной в олимпиадной математике и кодинге, но на открытых задачах с тонкими формулировками и неполными условиями начинается то, что разработчики описывают максимально прямо: высокая склонность к ошибкам и подмена исходной постановки более удобной.
Если переводить на практику, то Gemini 3 Deep Think и Aletheia выглядят как продвинутые помощники для гипотез, черновиков и первичной разведки по источникам — но не как система, которой можно безоговорочно доверить выводы. И, возможно, это самый здоровый месседж в этой истории: даже когда цифры в бенчмарках впечатляют, контроль человеком в серьёзных задачах всё ещё обязателен.
Gemini 3 Deep Think — заметный шаг Google в сторону прикладного «рассуждающего» ИИ для науки и инженерии, с сильными результатами в тестах и отдельным агентом Aletheia для исследовательской работы. Но компания сама фиксирует ключевую проблему: модель всё ещё может подгонять интерпретацию задачи под удобный ответ и часто ошибается, так что ждать «замены учёных» рано — скорее стоит ждать новых инструментов, где ИИ будет мощным, но контролируемым напарником.