Google выпустила крупное обновление Gemini 3 Deep Think — «рассуждающего» ИИ-режима, который компания позиционирует как инструмент для науки и инженерии. На бумаге всё выглядит мощно: высокие результаты в бенчмарках, уверенная математика и программирование, плюс отдельный агент для исследовательских задач.

Но есть нюанс, знакомый всем, кто хоть раз пытался «поспорить» с нейросетью: даже в таком продвинутом варианте модель может неверно понять вопрос так, чтобы на него было легче ответить. Разработчики прямо признают — по сравнению с людьми система всё ещё крайне ошибочна, и до замены исследователей ей далеко.

Что именно обновили и кому это доступно

Новая версия Gemini 3 Deep Think создавалась вместе с учёными и заточена под задачи, где часто нет единственного правильного ответа, а данные могут быть неполными или несистематическими. То есть это попытка сделать ИИ не просто «болталкой», а более прикладным инструментом для реальных исследований.

Продолжение после рекламы

Режим Deep Think появился прямо в приложении Gemini, но воспользоваться им смогут только подписчики Google AI Ultra. Параллельно Google впервые обещает открыть доступ к сервису через API Gemini — но не всем подряд: инженерам, исследователям и компаниям придётся подать заявку.

Важный момент: речь не про «ещё одну модель для чата», а про платформу, которая должна помогать разбирать сложные постановки, где ограничения размыты, а исходные условия могут быть сформулированы неидеально. Именно на таких задачах обычно и ломается большинство ИИ — и именно здесь Google пытается поднять планку.

Результаты бенчмарков: цифры выглядят впечатляюще

Google сопровождает релиз набором метрик, и они действительно звучат громко. В тесте Humanity’s Last Exam Gemini 3 Deep Think набрала 48,4% без использования сторонних инструментов. В бенчмарке ARC-AGI-2 результат составил 84,6%, что в исходном материале описывается как беспрецедентный показатель.

По программированию тоже всё бодро: в задачах Codeforces модель получила рейтинг 3455 Elo. А в задачах Международной математической олимпиады 2025 система показала уровень золотой медали. Тот же уровень, по данным Google, она продемонстрировала на олимпиадных задачах по химии и физике.

Отдельно упоминается CMT-Benchmark, где Deep Think показал высокий уровень владения теоретической физикой, но с результатом 50,5%. Это хороший маркер того, что даже при сильных «витринных» достижениях остаются области, где модель не выглядит всемогущей — особенно если тест ближе к специализированной теории, а не к задачам с узнаваемыми шаблонами.

Aletheia: исследовательский агент на базе Deep Think

Gemini 3 Deep Think стала основой для ИИ-агента, который в Google DeepMind называют Aletheia. Его идея — не просто выдавать ответ, а сопровождать работу механизмами самопроверки: агент включает средство проверки гипотез, изложенных естественным языком, чтобы находить слабые места в предлагаемых решениях.

Работа строится итеративно: генерация решения, критика, корректировка и новый заход. Причём разработчики подчёркивают важную для научной сферы вещь: агент может признать, что не способен дать ответ. Это звучит банально, но на практике именно «неумение остановиться» часто превращает ИИ в фабрику уверенных ошибок.

Для сложных исследований Aletheia подключает поиск Google и инструменты веб-навигации. В описании подчёркивается, что при подготовке сводок по опубликованной литературе агент не выдаёт несуществующих ссылок и старается избегать вычислительных неточностей. Это всё ещё не гарантия идеальной точности, но хотя бы попытка закрыть две классические боли: галлюцинации источников и «поплывшие» расчёты.

Уровни достижений Aletheia разработчики разложили по пяти градациям — от скромных результатов до «знаменательного прорыва». Пока агенту удалось добраться лишь до второго уровня («пригодно для публикации») в разных режимах — автономном, совместной работы с человеком и как вспомогательный инструмент. Третий («значительный прорыв») и четвёртый («знаменательный прорыв») уровни ему пока не покорились.

Продолжение после рекламы

Где ИИ спотыкается: подгонка задачи под ответ

Самая интересная часть истории — там, где Google честно показывает ограничения. По заданию разработчиков Aletheia проанализировал 700 нерешённых математических задач, сформулированных Палом Эрдёшем. В итоге агент «осилил» 13 задач, но и здесь есть оговорки: для 9 из них уже существовали решения, а действительно впервые решёнными выглядят лишь 4.

Ещё жёстче выглядит статистика по качеству выходных решений. Из 212 решений, которые выдал ИИ, «содержательно правильными» признали лишь 6,5%. Остальные либо имели фундаментальные недостатки (68,5%), либо решали неправильно интерпретированные агентом версии исходных задач (31,5%).

Именно отсюда и формулировка, которая цепляет сильнее любых 84% в бенчмарках: разработчики согласились, что ИИ проявляет склонность неверно понимать вопрос таким образом, чтобы на него было легче ответить. По-человечески это выглядит так: модель как будто «срезает угол» — не всегда осознанно, но системно. А в науке и инженерии такая привычка опаснее, чем просто «ошибка в факте».

Что это значит для пользователей и рынка

Для обычных пользователей новость в первую очередь про доступность: Deep Think теперь в приложении Gemini, но фактически это привилегия подписчиков Google AI Ultra. Для профессионалов важнее другое — обещанный доступ через API. Если Google действительно начнёт пускать исследовательские команды и компании, это может ускорить появление специализированных инструментов: от анализа литературы до автоматизации части рутины в R&D.

Но Google одновременно даёт понять, что «магического учёного в коробке» не получилось. Да, модель может быть сильной в олимпиадной математике и кодинге, но на открытых задачах с тонкими формулировками и неполными условиями начинается то, что разработчики описывают максимально прямо: высокая склонность к ошибкам и подмена исходной постановки более удобной.

Если переводить на практику, то Gemini 3 Deep Think и Aletheia выглядят как продвинутые помощники для гипотез, черновиков и первичной разведки по источникам — но не как система, которой можно безоговорочно доверить выводы. И, возможно, это самый здоровый месседж в этой истории: даже когда цифры в бенчмарках впечатляют, контроль человеком в серьёзных задачах всё ещё обязателен.

Gemini 3 Deep Think — заметный шаг Google в сторону прикладного «рассуждающего» ИИ для науки и инженерии, с сильными результатами в тестах и отдельным агентом Aletheia для исследовательской работы. Но компания сама фиксирует ключевую проблему: модель всё ещё может подгонять интерпретацию задачи под удобный ответ и часто ошибается, так что ждать «замены учёных» рано — скорее стоит ждать новых инструментов, где ИИ будет мощным, но контролируемым напарником.

Рейтинг: 0 / 5. Оценок: 0

Рекомендуем почитать

Оставьте комментарий

Перед оставлением комментария, пожалуйста, ознакомьтесь с правилами комментирования.