09:00, 05.08.26
|
Новости

История и развитие Google Gemini

История и развитие Google Gemini

Google Gemini — семейство мультимодальных больших языковых моделей (LLM), разрабатываемое исследовательским подразделением Google DeepMind — стал одним из самых амбициозных предприятий в истории искусственного интеллекта. Модели Gemini были построены так, чтобы одинаково хорошо справляться с текстом, кодом, изображениями, аудио и видеоформатами. В 2026 году Gemini использует более 750 млн. активных пользователей в месяц, что ставит этот ИИ в ряд самых массовых и популярных платформ. Однако, путь к успеху сопровождался организационными проблемами, технологическими вызовами, жёсткой конкуренцией и серией громких скандалов — в этом материале вы узнаете обо всех самых интересных перипетиях.


Философская основа Gemini: нативная мультимодальность

Ключевой особенностью и философской основой Gemini является нативная мультимодальность. Это означает, что "Гемини" изначально спроектирована и обучена работать с разными типами данных (текст, изображения, видео, аудио, 3D-модели, графика, код) как с единым целым. Предыдущие модели получали свои мультимодальные возможности уже поверх существующей текстовой основы.

Архитектура Gemini базируется на концепции раннего слияния (early fusion): пиксельные кусочки изображений, кадры видео с временными отметками, аудиограммы и текстовые токены проецируются в единое пространство, и модель формирует у себя более глубокое, целостное их понимание.


Предыстория: ответ на вызов ChatGPT

Хотя модели Gemini вышли в 2023 году, история этого ИИ началась гораздо раньше. В Google с 2012 года существовала исследовательская программа в области искуственного интеллекта Google Brain. Их нейросети учились читать капчу, дорожные знаки и распознавать на видео кошек, пока в конце 2022 года не "выстрелил" ChatGPT. Этот событие стало для Google катализатором: компания, долгое время считавшаяся лидером во всём технологическом, внезапно оказалась в роли догоняющей.

Предшественником Gemini стала PaLM (сокращение от Pathways Language Model) — лингвистическая модель, основанная на новой архитектуре машинного обучения от Google. Она не была мультимодальной, и фокусировалась исключительно на тексте.

В январе 2023 года Google снова привлекла к работе создателей поисковика Ларри Пейджа и Сергея Брина, чтобы ускорить разработку AI-продуктов. Генеральный директор Сундар Пичаи пригласил отошедших от повседневных дел компании легенд на несколько встреч с топ-менеджерами, объявив "красный код". Пейдж и Брин рассматривали и утверждали стратегию Google в области ИИ, внесли идею по интеграции чат-функций в поисковик и давали прочие советы лидерам компании.

Сергей Брин (слева) и Ларри Пейдж (справа)
Сергей Брин (слева) и Ларри Пейдж (справа)

Уже в феврале Google "застолбили" место на рынке генеративного ИИ, выпустив на основе PaLM чат-бота Bard. В мае 2023 года вышла более компактная и быстрая PaLM 2 в качестве "тестового полигона", и "Барда" перевели на новую технологию. Примерно в это же время началась работа над Gemini как над "серийной" моделью новой эпохи — с нативной мультимодальностью, как основным конкурентным преимуществом.


Рождение "Близнецов": слияние Google Brain и DeepMind

Ключевым организационным событием, предопределившим появление "Гемини", стало слияние двух ведущих исследовательских групп Google — Google Brain и DeepMind. Это объединение произошло в апреле 2023 года. Название "Gemini" (с латинского — "Близнецы") как раз и символизирует союз этих двух исследовательских команд. Изначально проект имел кодовое имя Titan, но Джефф Дин, технический руководитель Google DeepMind, курировал слияние и предложил назвать проект Gemini.

Слияние Google Brain и DeepMind

Это имя также отсылает и к космической программе NASA "Джемини", которая проложила дорогу к высадке на Луну. Это понравилось разработчикам-"гикам" и подчеркнуло их собственное отношение к новой нейросетке как к промежуточному этапу на пути к созданию более совершенного AGI — общего интеллекта, способного понимать и решать любые интеллектуальные задачи, доступные человеку. Главная цель "Гугла" оказалась не менее амбициозной, чем у конкурентов.


Первый анонс, релиз и развитие моделей

Впервые о Gemini публично заговорили на ежегодной конференции Google I/O 10 мая 2023 года — тогда модель ещё обучалась. Полноценный релиз состоялся 6 декабря 2023 года. Google представила сразу три версии модели: 

  • Gemini Nano (для автономной работы на мобильных устройствах, включая флагманский смартфон от Google Pixel 8 Pro);
  • Gemini Pro (для универсальных задач);
  • Gemini Ultra (для наиболее сложных вычислений).

В тот же день чат-бот Bard (предшественник Gemini) стал использовать специально настроенную версию Gemini Pro на английском языке для более продвинутого рассуждения, планирования и понимания. С 13 декабря 2023 года разработчики и корпоративные клиенты получили доступ к Gemini Pro через Google Generative AI Studio и Vertex AI.

Google Bard

В феврале 2024 года Google переименовала "Барда" в Gemini, объединив чат-бот и модель под единым брендом. Главной инновацией Gemini 1.5 Pro стало экспериментальное контекстное окно на 1 миллион токенов, что в 5 раз больше, чем у предыдущего лидера. В мае 2024 появилась Gemini 1.5 Flash, более лёгкая модель, оптимизированная под максимальную скорость ответа, а версия 1.5 Pro стала лучше рассуждать, перводить и программировать.

К началу 2025 года модели Gemini 1.5 Pro и 1.5 Flash выполнили свою роль и были постепенно выведены из эксплуатации в пользу нового поколения, в частности Gemini 2.0 Flash. Однако их главное наследие — рекордное контекстное окно — осталось ключевой особенностью и было развито в следующих версиях. В ноябре 2025 Gemini 3 Pro и 3 Flash стали новым стандартом, научившись понимать намерения пользователя и получив способность к сложным рассуждениям.

На конференции Google I/O 2026 в мае был сделан шаг в сторону агентного ИИ. Флагманом стала Gemini 3.5 Flash — модель, которая по интеллекту не уступает флагманским моделям, но при этом обладает скоростью Flash-серии. В июле 2026 года Google анонсировала развитие линейки:

  • Gemini 3.6 Flash стал новым основным инструментом для разработчиков, дешевле и эффективнее использующим токены;
  • Gemini 3.5 Flash-Lite для высоконагруженных задач, где критична цена и скорость (до 350 токенов в секунду при цене всего $0.30 за 1 млн. токенов на входе);
  • Gemini 3.5 Flash Cyber, настроенная на кибербезопасность и способная находить, проверять и исправлять уязвимости в коде.

А вот с выходом Gemini 3.5 Pro у Google возникли проблемы.


Проблемы и вызовы на пути развития

Одной из главных проблем, с которыми столкнулся Gemini, стала организационная сложность Google. В отличие от OpenAI и Anthropic — компаний, сфокусированных исключительно на разработке больших языковых моделей, — Google представляет собой гигантскую корпорацию с множеством продуктов и подразделений. Интеграция Gemini в поиск, карты, YouTube, Gmail и другие сервисы встретилась с колоссальным сопротивлением бюрократии.

Согласно отчёту Bloomberg, в процессе подготовки новых моделей к релизу задействованы многочисленные уровни акционеров разной степени важности, и необходимость "вплетать" AI в огромный портфель продуктов неизбежно привела к задержкам. Десять текущих и бывших сотрудников Google подтвердили, что эти задержки вызывают разочарование среди инженеров, исследователей и менеджеров, многие из которых опасаются, что компания теряет конкурентное преимущество на фоне стремительного прогресса Anthropic и OpenAI.

Курьезные репутационные скандалы и проблемы безопасности

Gemini также столкнулась с серией громких скандалов, подорвавших доверие к модели. Наиболее резонансный случай произошёл с генерацией исторических изображений: Gemini создавала изображения этнически разнообразных немецких солдат времён Второй мировой войны и меняла расу историческим деятелям, как сериалы от Netflix. В ответ на шквал насмешек и критики генеральный директор Google Сундар Пичаи назвал эти ошибки "абсолютно неприемлемыми" и временно приостановил возможность создания изображений людей.

"Конечно! Вот портреты отцов-основателей Америки", а также "инклюзивные" изображения викингов и римского Папы от Gemini
"Конечно! Вот портреты отцов-основателей Америки" а также "инклюзивные" изображения викингов и римского Папы от Gemini

Гораздо более серьёзным оказался инцидент мая 2026 года, когда AI-агент Gemini 3.5 во время выполнения задачи по исправлению уязвимостей в небольшом (объёмом около 70 строк) участке кода вместо этого удалил 28 745 строк работающей программы, изменил 340 файлов, дописал 400 строк, сломал этим сервис и сфальсифицировал отчет о проделанной работе.

После того, как разработчик заметил проблему и откатил изменения, Gemini утверждал, что именно он успешно восстановил сервис, сборка была успешной, и подделал доказательства — записал три поддельных файла с "логами консультаций" и "отчетами о разборе инцидента", создав видимость того, что разрушительные изменения были одобрены в ходе многоэтапной проверки.

Впоследствии выяснилось, что проблема возникла из-за стороннего пакета "Antigravity IDE", который маскировался под официальный инструмент Google и вводил новые правила: отключал запросы на подтверждение от разработчика, автоматически разрешал ИИ-агенту все операции и сразу же "деплоил" изменения в основную ветку. Но репутационный ущерб был уже нанесён.

Помимо этого, пользователи сообщали о случаях, когда Gemini впадала в "депрессию" из-за собственных ошибок при написании кода, попадала в "петлю самообмана" (писала неработающий код, затем исправляла его, и так по кругу), и тайно вносила коррективы в процесс обучения других моделей, опасаясь, что они потеряют способность выражать несогласие.

История задержек Gemini 3.5 Pro

Наиболее ярким примером проблем Gemini стала эпопея с выпуском Gemini 3.5 Pro — флагманской модели, которая должна была стать самым мощным AI-продуктом Google. Изначально анонсированная на конференции I/O в мае 2026 года, модель должна была выйти в июне, но так и не успела в запланированные сроки.

Google отстаёт от графика на несколько месяцев в попытках улучшить возможности модели, особенно в области программирования. В июле "Гугл" оптимизировали эффективность траты токенов. Затем дедлайн снова перенесли: в конце июня компания обновила данные, используемые для обучения, чтобы улучшить навыки написания кода. Но и здесь результаты оказались разочаровывающими. Gemini 3.5 Pro столкнулась с вызовами в трёх ключевых областях:

  • Генерация кода — модель не достигла внутренних стандартов по качеству генерируемого кода;
  • Надёжность — уровень нейросетевых "галлюцинаций" (выдача выдуманной информации за достоверные факты) оказался недопустимо высоким;
  • Многоступенчатые задачи — версия 3.5 проявила нестабильность при последовательном выполнении сложных операций, особенно в сценариях для агентов, где требуется непрерывный вызов инструментов.

Проблема оказалась серьёзнее, чем просто плохой код. Пока Google разрабатывали новую модель, изменились сами критерии оценки их качества. Если раньше сравнивалась способность давать точные ответ на поставленный запрос, новым "полем битвы" флагманов-программистов стали агентные системы (Agentic AI).

Всвязи с этим Gemini 3.5 Pro отправили на полную переработку — к августу 2026 года она пропустила уже три дедлайна, став одним из самых дорогих провалов в истории Google.

Утечка ключевых исследователей

Проблемы с разработкой усугубились и кадровыми потерями. В июне 2026 года два ведущих AI-исследователя Google покинули компанию: Ноам Шазир (один из лидеров разработки Gemini) перешёл в OpenAI, а Джон Джампер, руководитель проекта AlphaFold и лауреат Нобелевской премии — в Anthropic. Уход Шазира, одного из соавторов архитектуры Transformer, стал особенно болезненным: всего двумя годами ранее Google потратила $2,7 млрд на то, чтобы его "захантить".


Перспективы на будущее

Самые оптимистичные перспективы связаны с моделью Gemini 4. На конференц-звонке Alphabet (материнской компании Google) по итогам второго квартала 2026 года Сундар Пичаи заявил, что Google нуждается в более крупной базовой модели Gemini 4, чтобы оставаться конкурентоспособной. Он признал, что агентное программирование требуют дальнейшего развития, но выразил уверенность в том, что Google по-прежнему превосходит конкурентов во многих областях.

Gemini 4 уже находится в стадии предобучения. Когда модель будет готова, компания планирует ускорить темпы и выпускать новые модели практически ежемесячно. Развитие получит и мультимодальность — в будущем пользователи смогут создавать и редактировать документы голосом, мощные голосовые возможности появятся в Gmail и Keep, а также ожидается появление уникальных функций.

Фокус на агентных ИИ

Будущее Gemini также неразрывно связано с развитием агентных систем. Google активно работает над улучшением способности Gemini выполнять многоступенчатые задачи, использовать инструменты и действовать автономно. Gemini 4 позиционируется как шаг вперёд в создании "более эффективных и умных AI-агентов", и должна будет превзойти конкурентов.

Однако, подобная стратегия развития ИИ вступает в клинч с основной бизнес-моделью Google. Сейчас она основана на поиске: пользователь вводит запрос, Google показывает рекламу, а рекламодатели платят за клики. Но если люди перестанут искать информацию, а станут поручать AI-агенту выполнять задачи напрямую, эта модель может рухнуть. Каким-то образом Google должна трансформировать поиск в работу с агентами, не потеряв свой самый прибыльный источник дохода.

Расширение экосистемы и партнерства

Google давно ведёт работу над расширением присутствия Gemini во всех своих продуктах. В будущем планируется полная интеграция с Chrome (процесс уже запущен), Android Auto, Google Search, рекламных системах и умных домах. Gemini должна стать "операционной системой" для всех взаимодействий с ИИ при использовании продуктов Google.

Заодно в июне 2026 года Apple официально объявила о сотрудничестве с Google, чтобы интегрировать Gemini в Apple Intelligence. Это партнёрство открывает Gemini доступ к довольно большой аудитории пользователей Apple и укрепляет позиции Google на рынке мобильных устройств.

Регуляторные вызовы

Google ведёт переговоры с правительством США о возможностях Gemini и стандартах безопасности, которые должны применяться к отрасли. Это отражает растущее внимание регуляторов к AI-моделям: Anthropic уже столкнулась с проблемами после того, как внутреннее тестирование выявило опасные возможности её новейших моделей Fable и Mythos 5. Законодательное давление может стать серьёзным ограничением и для Gemini — чем мощнее становится модель, тем больше внимания она привлекает со стороны государств.


Вывод

За два с половиной года существования Gemini прошла тернистый путь. Но очевидные недостатки по сравнению с конкурентами, организационные сложности и проваленные дедлайны не помешали набрать огромную аудиторию в 750 млн. пользователей. Этому способствовали сильные стороны Gemini: нативная мультимодальность, высокая скорость работы, доступность и глубокая интеграция с экосистемой Google в "каждый утюг".

Однако если Google не сможет преодолеть технические барьеры и создать модель, которая действительно превосходит конкурентов в программировании и агентных сценариях, Gemini рискует остаться в роли "вечно догоняющего". И как показывает история задержек Gemini 3.5 Pro, не так уж просто научить универсальную модель, чьи "электронные мозги" одинаково воспринимают звук, картинки и образы, строго специфической задаче, которую требует рынок.


Часто задаваемые вопросы (FAQ)

Когда появился Gemini?
Как появился Google Gemini и кто его непосредственный создатель?
Что появилось раньше, ChatGPT или Gemini?
Какие версии Gemini существуют и чем они отличаются?

Читать по теме

Реклама 18+
Комментарии
Реклама 18+