Google разрабатывает революционный «замороженный» серверный чип: как это изменит индустрию искусственного интеллекта

Замороженные чипы Google и Taalas: как нейросеть встраивают в кремний, резко снижая энергопотребление и ускоряя ИИ-вычисления.
Павел Ельцов 22 августа 2026 в 12:45

Издание The Information сообщило, что Google разрабатывает серверный чип под кодовым названием Frozen («замороженный»). Название может навести на мысль о жидком азоте и экстремальном охлаждении, но смысл совсем в другом. Речь не о температуре, а о том, что сама нейросеть в таком чипе буквально «застывает» в кремнии.

Обычные ускорители исполняют модель как программу: считывают её параметры из памяти, прогоняют через вычислительные блоки и выдают результат. Замороженный чип устроен иначе: модель перестаёт быть загружаемым набором чисел и становится частью физической структуры микросхемы.

Это не единичная идея Google, а целый класс технологий. Более того, Google здесь не лидер: по крайней мере в плане готового железа её уже опередили.

Канадский стартап опередил гигантов

В феврале 2025 года канадская компания Taalas представила чип, в который физически встроена открытая модель.. По заявленным данным, он способен выдавать до 17 000 токенов в секунду. Для сравнения: ускорители Nvidia на той же модели обычно дают одному пользователю лишь несколько сотен токенов в секунду. Разница — почти на порядок и больше.

На первый взгляд это выглядит слишком хорошо, чтобы быть правдой, но у такого отрыва есть понятное физическое объяснение. Чтобы его понять, нужно разобраться в главной проблеме современных ИИ-ускорителей.

Главная проблема современных ускорителей: «стена памяти»

Почти все вычислительные системы построены на архитектуре фон Неймана: память отдельно, вычислитель отдельно. Данные нужно постоянно переносить из памяти в вычислительные блоки и обратно.

Десятилетиями это работало нормально, но с нейросетями ситуация изменилась. Когда языковая модель генерирует даже один токен, чипу приходится читать огромные массивы весов из памяти, перемещать их по кристаллу, выполнять операции, а затем повторять всё заново для следующего токена.

В результате значительная часть энергии уходит не на математику, а на доставку чисел к месту вычисления. Тысячи вычислительных ядер часто просто ждут очередную порцию данных.

На физическом уровне это очень дорого. Передача одного бита из HBM-памяти в вычислительное ядро требует больше энергии, чем сама базовая операция умножения с накоплением. В масштабах серверов получается парадокс: львиная доля мощности расходуется не на вычисления, а на перемещение данных. Для GPU оценки доходят до 93–95% энергозатрат только на движение весов между памятью и вычислителем.

Именно этот предел и называют «стеной памяти».

Почему проблему не удаётся просто «залить железом»

Индустрия давно пытается пробить эту стену: появляются новые стандарты памяти вроде HBM4, растёт пропускная способность, усложняются архитектуры ускорителей. Но быстрее становится только сама «труба» — необходимость гонять данные туда-сюда никуда не исчезает.

Проблема усугубляется тем, что модели растут быстрее, чем ускоряется память. Каждый новый миллиард параметров — это ещё больше данных, которые нужно хранить и перемещать. Отсюда и гигантские расходы.

Alphabet, по данным на 2025 год, тратила на инфраструктуру десятки миллиардов долларов за квартал, а на 2026 год закладывала ещё более масштабные капвложения. И даже таких бюджетов оказалось недостаточно: вычислительных мощностей не хватает, а крупным клиентам облаков уже приходится ограничивать доступ к ресурсам.

У этого бума есть и побочный эффект для обычных пользователей: крупнейшие операторы дата-центров заранее выкупают огромные объёмы высокоскоростной памяти, из-за чего дефицит и рост цен постепенно расползаются по всему рынку.

Радикальная идея: а если веса вообще не перемещать?

Замороженный чип предлагает не ускорять доставку данных, а убрать саму необходимость доставки. Если веса модели неизменны, почему бы не сделать их частью аппаратуры?

К этой идее индустрия пришла не сразу. До неё были промежуточные подходы.

Подход Cerebras: разместить всё на одном гигантском чипе

Компания Cerebras решила проблему за счёт масштаба: если обращение к удалённой памяти дорого, нужно разместить как можно больше памяти прямо на кристалле. Их WSE-3 хранит модель во внутрикристалльной памяти объёмом 44 ГБ, а внутренняя пропускная способность достигает 21 ПБ/с.

Плюс очевиден: не нужно постоянно обращаться к внешней памяти. Минус тоже очевиден: это работает только до тех пор, пока модель помещается в доступный объём. Для действительно огромных моделей такой подход быстро упирается в физические пределы.

Подход Groq: убрать хаос и сделать всё предсказуемым

Компания Groq пошла другим путём. Обычные процессоры и GPU тратят часть ресурсов на планирование, выбор инструкций, работу кэшей и распределение задач на лету. Groq отказалась от этой универсальности и заранее определяет маршруты движения данных ещё на этапе компиляции.

Это резко снижает стоимость передачи бита: примерно до 0,3 пикоджоуля против около 6 пикоджоулей у HBM. Но даже здесь чип остаётся программируемым процессором, который всё ещё исполняет модель.

Следующий шаг: модель как часть железа

Логика замороженного чипа проста: веса обученной модели не меняются от запроса к запросу. Если так, то зачем снова и снова таскать их из памяти в вычислитель? Почему бы не превратить сами веса в элемент физической схемы? Именно это делает Taalas.

Как устроен HC1 от Taalas

Первый чип компании называется HC1. Это огромный кристалл площадью около 850 мм², произведённый по техпроцессу TSMC 6 нм, с 53 миллиардами транзисторов.

Главное в HC1 — даже не то, что в нём есть, а то, чего в нём нет:

  • нет HBM-памяти;
  • нет сложных межчиповых интерфейсов;
  • нет привычной архитектуры ускорителя с постоянной перекачкой весов.

По сути, остаётся только то, что нужно для ввода промптов и работы с контекстом, например PCI Express. В сравнении с обычным ИИ-ускорителем это выглядит так, будто из автомобиля убрали бак, бензонасос и топливопровод, а он всё равно едет.

Где в таком чипе хранятся веса

Веса модели записываются в масочное ПЗУ. В обычной памяти информация хранится как электрический заряд, который нужно поддерживать или регулярно обновлять. В HC1 веса представлены иначе: как наличие или отсутствие микроскопических металлических соединений в верхних слоях кристалла.

Иными словами, знания модели существуют не как файл и не как заряд в ячейке памяти, а как геометрия металла. Модель буквально становится узором проводников внутри чипа.

Как удалось избежать полного перепроектирования под каждую модель

Логичный вопрос: если под каждую модель нужен свой рисунок проводников, не придётся ли каждый раз делать новый чип с нуля?

В этом и состоит главный инженерный трюк. Базовая кремниевая подложка остаётся универсальной и выпускается массово. Меняются только два верхних металлических слоя, где и задаётся конкретная модель. То есть из многих слоёв кристалла специализированными становятся лишь последние.

Это всё ещё дорого, но уже не так радикально, как полное перепроектирование всей микросхемы.

Как происходят вычисления

В обычных GPU умножитель универсален: ему можно подать любые два числа. Но за эту универсальность приходится платить транзисторами, энергией и сложностью.

В HC1 веса известны заранее и жёстко квантованы до 3 бит, то есть у каждого веса всего 8 возможных значений. Поэтому вместо полноценного умножения используется более дешёвая схема multiply-select-add:

  1. входная активация заранее умножается на все 8 возможных значений веса;
  2. система выбирает нужный вариант;
  3. результат отправляется на суммирование.

То есть чип не столько «вычисляет», сколько выбирает готовый вариант, соответствующий зафиксированному в металле весу. Умножение как универсальная операция фактически заменяется селекцией.

Что происходит с контекстом

Разумеется, не всё в диалоге можно зашить в металл. Контекст разговора постоянно меняется, и его нужно где-то хранить. Для этого на кристалле остаётся обычная SRAM, где размещаются:

  • KV-кэш текущего диалога;
  • служебные данные;
  • вспомогательные операции вроде нормализации и активаций.

Граница очень чёткая: всё постоянное — в металле, всё изменяемое — в памяти.

Как решается проблема кастомизации под бизнес

Ещё одно очевидное возражение: компаниям редко нужна «голая» базовая модель. Им нужны версии, дообученные под юридические тексты, медицину, документооборот и другие прикладные задачи.

Здесь помогает LoRA. Базовая модель остаётся зафиксированной в кремнии, а небольшие адаптеры размером в десятки или сотни мегабайт загружаются в перезаписываемую память. Благодаря этому один и тот же чип может быстро переключаться между специализированными сценариями, не меняя фундаментальную основу.

Почему это так впечатляет

Заявленные характеристики HC1 выглядят очень агрессивно:

  • 250 Вт энергопотребления;
  • обычное воздушное охлаждение;
  • 16–17 тысяч токенов в секунду.

Для сравнения, H100 на той же модели даёт около 150 токенов в секунду и потребляет 300–400 Вт, причём без полного учёта затрат на HBM и охлаждение. Даже если относиться к цифрам осторожно, разрыв всё равно выглядит огромным.

Ещё показательнее метрика джоули на токен. Универсальные системы на H100 тратят примерно 10–30 Дж на токен. У Groq это около 1 Дж. У HC1 — порядка 0,1 Дж. То есть выигрыш уже не просто в скорости, а в фундаментальной энергоэффективности.

Насколько велик теоретический запас

С точки зрения физики это ещё далеко не предел. Существует фундаментальная нижняя граница энергозатрат на изменение одного бита — принцип Ландауэра. Современные вычислительные системы всё ещё работают на много порядков выше этого порога.

Иными словами, нынешние серверы для ИИ по эффективности всё ещё находятся очень далеко от физического минимума. На этом фоне замороженные чипы выглядят не просто инженерной хитростью, а попыткой приблизиться к более естественной форме вычислений.

Практический плюс: простота внедрения

Если убрать из ускорителя HBM, 3D-упаковку, сложные межчиповые интерфейсы и жидкостное охлаждение, получается устройство, которое гораздо проще ставить в обычные дата-центры.

Именно поэтому идея так привлекательна: вместо экзотической инфраструктуры можно получить PCIe-карту на 250 Вт, которая не требует радикальной переделки стойки, питания и охлаждения.

История проекта Google

У Google у этой идеи есть внутренняя история. Её связывают с Джеффом Дином, одним из ключевых архитекторов инфраструктуры машинного обучения в компании.

Первая версия проекта Frozen была даже радикальнее подхода Taalas: предполагалось жёстко печатать в кремнии не только структуру сети, но и сами веса Gemini. Это дало бы максимум эффективности, но руководство проект не одобрило. Причина понятна: новые версии модели появляются слишком быстро, и чип рисковал устареть ещё до массового запуска.

Frozen V2: компромисс между жёсткостью и гибкостью

После этого появился Frozen V2 с идеей Flexible Hard Coding. В этой версии в кремнии фиксируют не сами веса, а архитектурный каркас модели: вычислительный граф, маршруты данных, специализированные блоки под механизмы внимания. А сами веса остаются обновляемыми.

Это позволяет выпускать новые версии Gemini без полной замены железа — но только если базовая архитектура модели не меняется слишком сильно.

Именно здесь и скрыт главный риск: чип окажется полезным лишь до тех пор, пока отрасль и сама Google продолжают использовать примерно тот же фундаментальный подход.

Ограничения Frozen V2

У такого компромисса есть серьёзные ограничения:

  • чип не сможет запускать сторонние открытые модели;
  • он будет привязан к определённому семейству архитектур;
  • если произойдёт серьёзный прорыв и рынок уйдёт от нынешних трансформеров, специализированный кремний может быстро устареть.

По данным из утечек и публикаций, первые кластеры с Frozen V2 могут появиться около 2028 года, но внутри самой Google дискуссия, похоже, ещё не закончена. Компания пытается найти баланс между максимальной эффективностью и риском слишком раннего устаревания.

Frozen не заменит TPU и GPU полностью

Важно понимать: Frozen V2 не рассматривается как универсальная замена традиционным ускорителям. Скорее, это сопроцессор для узкого класса задач — прежде всего для быстрой генерации токенов на стабильной архитектуре Gemini.

Всё нестандартное, экспериментальное и меняющееся останется на обычных TPU и других программируемых чипах. Frozen — это ставка на те участки вычислений, где поведение модели уже достаточно предсказуемо, чтобы его было выгодно зашить в железо.

Четыре серьёзных недостатка технологии

1. Потеря точности

Чтобы уместить огромную модель в один кристалл, веса приходится жёстко сжимать. Основная масса кодируется 3 битами, критичные параметры — 6 битами. Это очень агрессивное квантование.

Проблема в том, что ниже 4 бит часто начинается так называемый accuracy cliff — резкий обрыв качества. Особенно страдают сложные задачи: длинные рассуждения, математика, программирование. Для простого разговора деградация может быть умеренной, но на интеллектуально тяжёлых сценариях она становится заметнее.

2. Низкий выход годных

HC1 — это очень большой кристалл, почти на физическом пределе литографии. Чем больше площадь, тем выше вероятность дефекта.

В памяти дефекты часто обходят резервными строками и столбцами. В масочном ПЗУ с жёстко заданной топологией это сделать намного труднее: если повреждён участок с критической логикой модели, кристалл может оказаться бесполезным. Значит, производство таких чипов потенциально дорогое и капризное.

3. Ограничение по размеру модели

Модель на 8 млрд параметров ещё можно вместить в один кристалл. Но более крупные модели, например на 70 млрд параметров, уже придётся разрезать на несколько кристаллов.

А вместе с этим возвращается та самая проблема, от которой технология пыталась уйти: межчиповый обмен данными. Он всё равно дешевле обращения к внешней памяти, но это уже не тот идеальный случай, где ничего никуда не перемещается.

4. Риск быстрого устаревания

Разработка заказного чипа занимает годы, а ИИ меняется почти ежемесячно. Если через пару лет индустрия перейдёт на принципиально новую архитектуру, замороженный кремний может устареть быстрее, чем успеет окупиться.

Именно поэтому универсальные ускорители по-прежнему сохраняют огромную ценность: они медленнее и менее эффективны, зато переживают смену поколений моделей.

Почему универсальность всё ещё важна

Можно возразить: не проще ли оставить всё на универсальных GPU и TPU? Их главный плюс как раз в том, что они способны адаптироваться под любой новый алгоритм. Появится новая архитектура — они её тоже запустят, пусть и без максимальной эффективности.

Поэтому вопрос не в том, нужна ли специализация вообще. Вопрос в том, сколько гибкости рынок готов отдать в обмен на выигрыш в энергии и цене вычислений.

Что будет, если технология приживётся

Если замороженные чипы станут массовыми, себестоимость ИИ-вычислений может упасть на порядки. Это откроет путь к более дешёвым и даже бесплатным сервисам на базе мощных моделей, не превращая обслуживание в бездонную статью расходов для облачных платформ.

Агенты и машинное взаимодействие

Человеку не нужны десятки тысяч токенов в секунду — мы просто не успеем их прочитать. Но такая скорость нужна машинам, которые обмениваются сообщениями друг с другом.

Если один агент ставит задачу второму, второй проверяет третьего, а затем вся цепочка возвращает результат пользователю, то внутренняя коммуникация должна укладываться в доли секунды. Здесь сверхбыстрые специализированные чипы особенно полезны.

Локальные модели в смартфонах

Если такие архитектуры научатся делать компактными и холодными, часть больших языковых моделей сможет перебраться прямо в пользовательские устройства — смартфоны, ноутбуки, бытовую электронику. Тогда ИИ будет работать локально: без облака, без задержек, без постоянной подписки и без отправки данных наружу.

Итог

Замороженные чипы — это радикальный отход от классической архитектуры фон Неймана. Они превращают нейросеть из программы в физическую структуру, тем самым устраняя фундаментальную проблему современной ИИ-инфраструктуры — дорогую и прожорливую перевозку данных между памятью и вычислителем.

Taalas уже показала рабочий пример такого подхода. Google разрабатывает собственную версию Frozen V2, рассчитывая развернуть первые системы примерно к 2028 году. Если идея выстрелит, она может заметно изменить экономику ИИ и весь подход к серверным вычислениям.

Но у технологии есть и серьёзные слабые места: потеря точности из-за жёсткого квантования, сложность производства, ограничения по размеру моделей и риск быстрого устаревания на фоне стремительной эволюции архитектур.

Дойдут ли замороженные чипы до массовых серверов? Появятся ли когда-нибудь в смартфонах? Пока неясно. Но одно уже видно: в энергоэффективности ИИ мы всё ещё в начале большого пути, и потенциал улучшений здесь колоссальный.

 

Wi-Fi видит сквозь стены? Разбираемся, как учёные научили обычный роутер «рентгеновскому зрению»

Может ли Wi-Fi видеть сквозь стены? Разбираем исследования MIT и Карнеги-Меллона — и почему в 2026 году это уже не просто эксперимент.
Павел Ельцов 8 июля 2026 в 12:30

В 1939 году, в одиннадцатом выпуске комикса Action Comics, Супермен впервые продемонстрировал способность видеть сквозь стены — эту суперспособность назвали рентгеновским зрением. Проблема в том, что реальный рентген для подобного трюка не годится: всё, что толще и плотнее человеческой кожи, становится непреодолимым препятствием для этих лучей. И тем не менее оказалось, что нечто очень похожее на рентгеновское зрение Супермена вполне реализуемо в реальности — только вместо трико супергероя понадобится куда более прозаичный предмет: обычный Wi-Fi-роутер.

Звучит эффектно, но как это вообще работает? Разве можно увидеть что-то сквозь стену с помощью Wi-Fi? Оказывается, можно — и это не досужие фантазии, а результат серьёзной научной работы: американские исследователи из Массачусетского технологического института (MIT) и Университета Карнеги — Меллона в своих работах убедительно показали, что это более чем возможно.

Растянувшаяся на несколько лет серия исследований, множество экспериментов и, конечно, хитро настроенные нейронные сети привели к появлению весьма занятной технологии, выросшей из самого обычного Wi-Fi. Разберёмся, как именно она работает и стоит ли всерьёз опасаться, что соседи смогут подглядывать за вами с помощью беспроводной сети.

С чего вообще можно начать, если хочется увидеть сквозь стену

Прежде чем переходить к Wi-Fi, стоит понять, как в принципе можно увидеть что-то сквозь непрозрачную преграду. Ближайшее из того, что уже существует и хорошо знакомо по кино, — это тепловизоры. В фильмах герои нередко «просвечивают» целое здание тепловизором и видят всех находящихся внутри людей. К сожалению, в реальной жизни это работает далеко не так эффектно: у тепловизоров очень небольшой угол обзора, так что охватить одним взглядом целое здание попросту не получится.

Но почему тепловизор вообще способен «видеть» людей сквозь преграды? Дело в том, что каждый человек излучает тепловые волны — мы их не видим, а лишь ощущаем, да и то не на расстоянии. Эти волны свободно проникают через непрозрачные препятствия, и именно их регистрирует тепловизор. Значит, фундаментально нужно что-то похожее, но проще и дешевле: некая волна, способная беспрепятственно проходить сквозь преграды, изменения которой при этом можно отслеживать.

Здесь и приходят на помощь радиоволны — ещё один вид излучения, не связанный с теплом, но точно так же способный проникать сквозь препятствия. Если бы радиоволны не обладали этим свойством, у нас не было бы ни FM-радио, ни Bluetooth, ни того же Wi-Fi. Это первая важная зацепка. Однако радиоволны бывают очень разными и отличаются друг от друга по частоте — от крайне низких (порядка 3 Гц) до сверхвысоких (300 ГГц и выше). Вдаваться в физику процесса на уровне отдельных частиц здесь не нужно — достаточно запомнить общее правило: чем выше частота волны, тем труднее ей проходить сквозь стены и тем сильнее теряется сигнал. Это касается не только радиоволн, но и звуковых: наверняка каждый замечал, что низкие басы прекрасно слышны сквозь стену — а вот сосед с дрелью по субботам слышен ещё лучше.

С другой стороны, для решаемой задачи нужно, чтобы волна при прохождении сквозь препятствие всё-таки заметно изменялась — иначе просто не получится понять, было ли на её пути препятствие вообще. Именно поэтому, например, обычные FM-волны для такой задачи не годятся: они проходят сквозь стены слишком уж беспрепятственно, почти не меняясь.

2015 год: как в MIT научились определять человека в комнате с помощью Wi-Fi

История начинается в 2015 году, в стенах Массачусетского технологического института. Именно тогда исследователи под руководством профессора Дины Катаби обратили внимание на высокочастотные радиоволны, которые буквально окружают нас повсюду и не требуют дорогого специализированного оборудования, — а именно на Wi-Fi, если точнее, на стандарт Wi-Fi 4, работающий на частоте 2,4 ГГц. На основе этого стандарта была создана технология, позволяющая определять местоположение человека в комнате. Разработку назвали Wi-Vi — сокращение от «Wi-Fi Vision», то есть «беспроводное зрение». Это, разумеется, ещё не полноценное рентгеновское зрение, но вполне обоснованно можно назвать её первым практическим шагом к нему.

Разберём принцип действия. Любой Wi-Fi-роутер или другое подобное устройство создаёт радиоволну, а смартфон эту волну принимает — и обратно посылает волну, несущую данные, например забавную картинку с котиком. Сама картинка, разумеется, никак не изменится, даже если между роутером и смартфоном окажется хоть пять стен подряд. А вот сама несущая волна изменится вполне заметно: сигнал станет слабее. Мощность Wi-Fi-сигнала измеряется в децибел-милливаттах, сокращённо dBm; это значение всегда отрицательное, причём около –30 dBm считается практически идеальным показателем, а –90 dBm означает фактическую потерю сигнала.

На мощность сигнала влияет буквально всё, что угодно, — и именно на этом строится вся идея исследования: любое препятствие любого размера и формы в пределах зоны покрытия сети так или иначе меняет сигнал. Убедиться в этом можно самостоятельно, установив на смартфон любое приложение для измерения уровня Wi-Fi-сигнала: даже если просто поставить руку между роутером и телефоном, показатели заметно изменятся. Получается, что по изменению мощности сигнала можно отслеживать изменения в окружающем пространстве. Правда, с одной важной оговоркой: точность подобного метода сама по себе крайне невысокая — по одному лишь показателю мощности можно понять разве что «есть препятствие или нет», не более того.

Чтобы отслеживать изменения куда точнее, нужно уже несколько передатчиков — так можно следить сразу за несколькими сигналами одновременно. В исследовании решили использовать несколько антенн для отправки сигнала и одну — для его получения. В обычных условиях между источником и приёмником Wi-Fi-сигнала находится множество препятствий: мебель, стены, другие устройства. Поэтому нужно было добиться того, чтобы все эти «фоновые» препятствия не мешали обнаруживать именно человека в поле действия сигнала. Для этого антенны-источники настроили таким образом, чтобы итоговый сигнал был равен нулю, если в отслеживаемой комнате никого нет. А как только в комнату кто-то заходит, сигнал меняется — потому что человек вносит изменения в распространение волны: часть её проходит сквозь тело, часть отражается, причём происходит это по-разному в зависимости от расстояния до источника сигнала — чем дальше находится человек, тем сильнее гасится сигнал. Значит, по характеру этих изменений можно определить, на каком расстоянии от измерительного устройства находится человек.

Впрочем, одного лишь расстояния недостаточно для точного местоположения — оно дало бы только окружность, где теоретически может находиться человек. Чтобы получить точные координаты, нужно определить ещё и угол относительно устройства: например, угол в ноль градусов означал бы, что человек находится прямо перед прибором. Принимающую антенну настроили так, чтобы она могла фиксировать угол, под которым к ней приходит сигнал, — а поскольку человек влияет ещё и на угол отражения волны, это в конечном счёте позволило довольно точно определять его местоположение в комнате. Помимо этого, у разработчиков получилось распознавать и падение человека — тоже благодаря характерным изменениям сигнала.

По словам самих исследователей, подобная технология способна работать даже сквозь бетонную стену толщиной 20 сантиметров. Они также предполагали, что подобную разработку стоит применять для наблюдения за пожилыми людьми: например, чтобы быстро отреагировать, если человек упал, — при этом сразу становится понятно, где именно он находится, а никаких проблем с приватностью, по их мнению, возникать не должно, поскольку на экране видна лишь точка на карте, а не изображение самого человека.

И всё же это по-прежнему далеко не то полноценное рентгеновское зрение Супермена, о котором шла речь в начале. Судя по всему, примерно так же рассудили и исследователи из другого университета — Карнеги — Меллона, — которые примерно год спустя предложили свою реализацию этой идеи, на этот раз с помощью нейронных сетей.

Карнеги — Меллон и нейросеть, которая «дорисовывает» человека по Wi-Fi-сигналу

В основе нового исследования по-прежнему лежал всё тот же стандарт Wi-Fi 4, да и общая суть не слишком изменилась: по-прежнему нужно было отслеживать изменения сигнала беспроводной сети. А вот реализация оказалась заметно сложнее.

Цель этой работы состояла не просто в том, чтобы найти в комнате одного человека, а в том, чтобы обнаружить сразу нескольких людей и, что особенно интересно, определить их позы и движения. Задача эта, очевидно, куда сложнее предыдущей, а значит, требует заметно больше исходных данных: количество передающих и принимающих антенн увеличили до трёх штук, а сигналы стали передавать по разным каналам Wi-Fi.

Дело в том, что Wi-Fi работает не на одной конкретной частоте, а в достаточно узком диапазоне: например, Wi-Fi-сеть на 2,4 ГГц использует частоты примерно от 2400 до 2484 МГц. На каждой отдельной частоте мощность сигнала при прохождении сквозь препятствие меняется по-своему, а чем выше частота, тем хуже сигнал проходит сквозь стены — этот принцип уже упоминался выше. Как и в предыдущем исследовании, сначала нужно зафиксировать, как сигнал распространяется в идеальных условиях, а затем отслеживать, как он меняется при появлении между передатчиком и приёмником людей, а также при их движении. Разница в том, что теперь данных стало кардинально больше, а результатом такой работы становится целый массив графиков.

Но как графики сигналов вообще превращаются в подобие «зрения сквозь стену»? Здесь в дело вступает нейросеть под названием DensePose — она изначально была разработана для работы с обычным видео и позволяет точно выделять людей в кадре, отслеживать их движения и проецировать эти данные на трёхмерную поверхность тела. По сути, DensePose объединяет в себе функции хромакея (зелёного экрана) и датчика глубины, но работает при этом исключительно на основе информации с обычной камеры — без какого-либо специального оборудования. Работает DensePose в два этапа: сначала распознаются отдельные части тела человека в кадре, а затем на эти части «накладываются» точки, изменения координат которых и отслеживаются в дальнейшем. Таким образом люди в кадре отделяются от фона.

Всё это, безусловно, любопытно само по себе, но у внимательного читателя вполне может возникнуть два закономерных вопроса. Первый — а зачем вообще всё это нужно? Второй — как это связано с исследованием на основе Wi-Fi-сигналов и кучи графиков?

Ответить на первый вопрос довольно просто: сфера применения подобной нейросети довольно широка — от замены традиционного хромакея при видеосъёмке до автономного транспорта, где такая система могла бы, например, распознавать жесты и движения регулировщика дорожного движения. Со вторым вопросом всё чуть сложнее. В исходном варианте DensePose определяет людей в кадре по данным с камеры, а в новом исследовании никакой камеры нет вовсе — есть только сигналы Wi-Fi. Тем не менее оба подхода, по сути, отслеживают изменения в окружающей среде, так что у исследователей возникла идея заменить данные с камеры на данные Wi-Fi-сигналов. Для этого пришлось создать ещё одну, отдельную нейросеть.

Для тренировки этой сети было записано 16 роликов продолжительностью около 13 минут каждый: в кадре постоянно находилось от одного до пяти человек, которые совершали разнообразные движения — ходили, двигали руками и ногами, вставали, ложились и так далее, — чтобы получить максимально разнообразный набор данных. Одновременно с видео записывались графики сигналов с Wi-Fi-антенн. В итоге новую нейросеть «скормили» сразу двумя видами данных: изображениями с людьми в кадре и тем, как эти же сцены распознаёт DensePose, — а также соответствующими графиками сигналов. Задача сети была проста в формулировке, хоть и сложна на практике: сопоставить сигналы Wi-Fi с тем, как DensePose распознаёт людей по видео, чтобы в дальнейшем воспроизводить схожий результат уже без использования обычной камеры. Для тренировки такой сети, по данным исследования, использовались четыре видеокарты NVIDIA Titan X — хотя авторы работы, к сожалению, не объяснили, почему выбор пал именно на это железо.

Результат подобной тренировки уже был показан в самом начале: нейросеть научилась распознавать людей в комнате примерно так, как это делал бы датчик глубины, — но вообще без использования каких-либо датчиков, кроме обычных Wi-Fi-антенн. К сожалению, стопроцентной точности добиться не удалось: нейросеть иногда ошибается при распознавании людей в помещении, ведь вариантов расположения нескольких человек в трёхмерном пространстве несоизмеримо больше, чем вариантов, которые можно закодировать в двумерных графиках сигналов даже с трёх антенн. Впрочем, подобная проблема вполне решаема — прежде всего за счёт увеличения объёма тренировочных данных.

Так стоит ли переживать за приватность?

На первый взгляд может показаться, что перед нами серьёзная угроза приватности: сейчас это, конечно, лишь исследовательский проект, но где гарантия, что уже через несколько лет подобная технология не станет доступна буквально каждому? Не самая обнадёживающая перспектива. Авторы соответствующих исследований, впрочем, склонны с этим не соглашаться: подобную нейросеть необходимо настраивать под конкретную среду, и даже незначительное изменение обстановки способно всё испортить — вплоть до того, что сдвиг источника или приёмника сигнала всего на несколько миллиметров или появление новой Wi-Fi-точки у соседей уже сделает предыдущую калибровку бесполезной. Получается, что для организации подобной слежки требуется весьма продолжительная и кропотливая настройка, а значит, сфера практического применения подобных исследований долгое время выглядела крайне ограниченной.

Здесь стоит сделать важное уточнение по состоянию на середину 2026 года — то есть спустя несколько лет после публикации этих исследований. Вывод об «ограниченной сфере применения» был во многом справедлив на момент выхода упомянутых работ, но за прошедшее время ситуация заметно изменилась, причём именно в сторону массового распространения подобных технологий.

Осенью 2025 года был официально утверждён стандарт IEEE 802.11bf — первый международный стандарт, целенаправленно созданный для так называемого Wi-Fi-сенсинга: распознавания движения, присутствия людей, жестов, падений и даже дыхания на основе того же самого принципа, что описан выше, — анализа изменений радиосигнала. Если раньше подобные разработки существовали разрозненно, в виде исследовательских проектов и фирменных, несовместимых друг с другом решений отдельных компаний, то новый стандарт впервые задаёт единые правила: как устройства должны согласовывать сеанс «прослушивания» пространства и обмениваться результатами измерений. Уже в начале 2026 года десятки производителей чипов — среди них, например, Qualcomm и Infineon — анонсировали поддержку этого стандарта в новых линейках Wi-Fi-модулей, а значит, подобная функциональность в обозримом будущем может появиться в самых обычных бытовых роутерах, а не только в специализированных лабораторных установках.

Более того, идеи из упомянутого исследования Университета Карнеги — Меллона уже вышли далеко за пределы академической среды: на их основе энтузиасты создали открытые программные проекты, позволяющие превращать сигналы обычных недорогих Wi-Fi-модулей в систему отслеживания человека через стены буквально из общедоступных компонентов стоимостью несколько долларов за штуку. Подобные разработки уже успели вызвать заметный общественный резонанс и новую волну дискуссий о приватности — тем более что, в отличие от истории 2015–2018 годов, единого правового регулирования подобного «сенсинга» пока попросту не существует ни в США, ни в Европе.

Иными словами, если несколько лет назад казалось, что технологии «Wi-Fi зрения» так и останутся нишевым лабораторным экспериментом из-за сложности настройки, то сегодня, с появлением единого отраслевого стандарта и растущей экосистемы производителей и разработчиков, перспективы её массового внедрения выглядят куда более реальными — а вместе с ними и вопросы о том, как защитить частную жизнь людей в мире, где обычный роутер способен «увидеть» их сквозь стену.

Итог

История, начавшаяся с забавной аналогии с рентгеновским зрением Супермена, довольно неожиданно привела к появлению вполне рабочей технологии, способной распознавать присутствие, движения и даже позы людей с помощью самого обычного Wi-Fi-сигнала — без единой камеры или специализированного датчика. Пройдя путь от лабораторных экспериментов MIT и Карнеги — Меллона до официального отраслевого стандарта, эта технология постепенно выходит за пределы научных статей — и, судя по всему, вопрос о том, как соседи (или кто-то ещё) в теории смогут «подглядывать» с помощью Wi-Fi, в ближайшие годы будет становиться всё менее гипотетическим.

 

Искусственный интеллект заменит Яндекс и Google? Большая история поиска в интернете

От первого поисковика Archie до ИИ-поиска: история интернет-поиска, Google, Яндекс и будущее с нейросетями и AGI
Павел Ельцов 7 июня 2026 в 12:30

Ещё каких-то тридцать пять лет назад интернет был совершенно жутким местом. Действительно настоящей паутиной — запутанной, непроходимой и лишённой каких-либо ориентиров. Только представьте себе: чтобы найти нужный ресурс, вам приходилось искать его адрес в газете или специальном печатном каталоге. Да, речь идёт о времени до изобретения поиска в интернете.

А ведь, если задуматься, именно поиск изменил нашу жизнь и десятикратно облегчил доступ к информации. Это напоминает то, что сейчас, в 2025 году, происходит с искусственным интеллектом. Не находите?

В этой статье мы проследим весь путь поиска в интернете: как он зародился, как работает, почему он столь важен и, главное, какое будущее его ждёт.

Поиск вчера: от газетных вырезок до алгоритмов

Условно историю поиска можно поделить на три эпохи: каким он был вчера, что представляет собой сегодня и каким станет завтра. Давайте по порядку.

Главная проблема интернета прошлого — это отсутствие нормальной поисковой системы. Выкручивались все по-разному. Кто-то записывал на бумажке нужные ссылки. В кружках по интересам печатали журналы с адресами полезных ресурсов, а иногда информация передавалась просто из уст в уста, по старинке. Конечно, существовали и веб-подборки — специальные страницы, на которых можно было вручную искать нужный интернет-сайт. Не слишком удобно, но такая ситуация была вполне логичной: контента было мало, пользователей тоже, и в основном это были технические энтузиасты. Бизнеса в интернете не существовало как такового.

Archie — первый поисковик в истории

И вот молодой канадский студент по имени Алан Эмтейдж (Alan Emtage) устал от такого положения дел. Осенью 1990 года он представил первый в истории поисковик интернета — Archie (сокращение от «Archives»). Конечно, по нынешним меркам это была примитивная система, но даже в таком виде она значительно упростила жизнь людям.

Archie объединял и индексировал содержимое общедоступных FTP-серверов. Возможно, кто-то ещё помнит такие «FTP-шники»: в те времена именно там можно было скачать игры вроде Duke Nukem, аниме или любой другой контент. Сервис собирал воедино названия файлов, а пользователю нужно было лишь ввести нужное ключевое слово. Проблема заключалась в том, что если в названии файла была ошибка, то Archie просто не мог его обнаружить.

Однако начало было положено. Цель тогда была проста: быстро находить хоть какую-либо подходящую информацию.

Индексация: библиотечная картотека для всего интернета

Чтобы двигаться дальше в изучении поиска, необходимо разобраться с одним чрезвычайно важным термином — индексация. Что вообще означает «проиндексировать интернет»?

Чтобы любой поисковик мог найти нужный ответ, ему сначала необходимо создать некую базу данных, в которой этот ответ будет храниться. Но ведь весь интернет — это колоссальный объём данных. По некоторым оценкам, речь идёт о нескольких зеттабайтах. Для понимания масштаба: один зеттабайт равен миллиарду терабайт. А по данным на 2025 год, в интернете накоплено уже несколько десятков зеттабайт информации. Естественно, поисковик физически не может пропускать через себя каждый раз такой массив данных. Именно поэтому было найдено подходящее решение — индексация.

Принцип прост. Специальный поисковый бот регулярно обследует всё интернет-пространство и обрабатывает информацию. Сначала программа-планировщик выстраивает маршрут для обхода сайтов. Этот маршрут зависит от важных характеристик сайтов — например, их цитируемости или частоты обновления. Затем планировщик передаёт этот маршрут другой части поискового робота — так называемому «пауку» (crawler). Паук обходит документы по заданному маршруту, и если сайт работает и доступен, он выкачивает содержимое и отправляет его в хранилище.

Таким образом, бот создаёт нечто вроде слепка интернета — библиотечной картотеки, если угодно, которая хранится на серверах. Туда переносится не весь интернет целиком, а только полезная информация — без спама, дубликатов и прочих ненужных документов. В результате получаются проиндексированные веб-страницы: поисковик знает адрес, по которому находится подходящий запросу пользователя контент — слова, изображения или любые другие данные.

После индексации слепок веб-сайта добавляется в регулярно обновляемую базу данных, чтобы поиск не занимал много времени. Визуально увидеть проиндексированную веб-страницу обычный пользователь не может, однако с помощью специального инструмента это всё же возможно. Например, у Яндекса существует сервис Вебмастер, где можно проверить свой ресурс на индексацию.

Таким образом, проиндексированные веб-страницы — это важнейший элемент любого поисковика, будь то Google, Microsoft Bing или Яндекс. Без подобной картотеки оперативно находить нужную информацию попросту невозможно.

WebCrawler — стандарт на десятилетие

Первым поисковиком, который стал использовать индексацию в более или менее современном виде, стал WebCrawler, запущенный в 1994 году. Его робот-«паучок» собирал информацию со всей сети, индексировал её и вносил в собственную базу данных. Разработка имела огромный успех и, в сущности, задала стандарт на десятилетие вперёд. Даже сейчас принципы, которые заложил WebCrawler, продолжают работать в основе современных поисковых систем.

Морфология языка: как Яндекс покорил великий и могучий

Но просто собрать и проиндексировать информацию — это лишь половина дела. Главное — правильно понять, что именно ищет пользователь. И здесь особенно интересен опыт Яндекса в работе с морфологией русского языка.

Дело в том, что поисковой системе необходимо находить не просто точное совпадение слов, а понимать смысл запроса. Подумайте сами: слово «шляпка» может относиться к грибу, головному убору или гвоздю. Русский язык полон подобных многозначных слов, что делает задачу на порядок сложнее, чем в английском.

Именно поэтому так показателен пример Яндекса. Компания анализировала, как часто слова встречаются вместе в текстах, используя данные Национального корпуса русского языка. Если пользователь ищет, например, «воронежский», система может автоматически добавить к поиску слово «Воронеж».

Яндекс также научился различать языки, чтобы не путаться при обработке запросов. Система определяла язык запроса по алфавиту, характерным сочетаниям букв и даже по региону пользователя. И, разумеется, люди постоянно допускают опечатки — примерно 12% поисковых запросов содержат ошибки. Поэтому поисковик автоматически проверял запрос на грамотность и предлагал исправленную версию.

Вот так, в зависимости от особенностей языка, поисковики справлялись с проблемами человеческих запросов.

Google и революция PageRank

Существовало и множество других поисковиков того времени — AltaVista, Excite и другие. Функционал у всех был примерно одинаковым, поэтому подробно останавливаться на каждом не имеет смысла. Важны первые и по-настоящему революционные.

Примерно в это же время, в 1998 году, два аспиранта из Стэнфордского университета — Сергей Брин и Ларри Пейдж — разработали поисковик Google. О нём, конечно, можно рассказывать долго. Но на самом деле важен не столько сам поисковик, сколько технология, которую для него разработали эти двое. Она называется PageRank.

Это была по-настоящему революционная вещь. Давайте разберёмся, в чём заключалась основная проблема поисковиков того времени. Да, благодаря индексации они могли находить ресурсы с нужной информацией, но вот качество найденных сайтов оставалось под большим вопросом. Грубый пример: если бы вы дали поисковику того времени запрос «как поменять лампочку», на первом месте мог бы оказаться не форум электриков, а сайт анекдотов. То есть релевантность поиска была практически на нуле.

PageRank же делал простую, но гениальную вещь. Алгоритм присваивал каждой странице показатель важности. Чем больше ресурсов в интернете ссылалось на определённую веб-страницу, тем более важной она становилась. Соответственно, при запросе пользователя на первые позиции выходила ссылка на тот ресурс, который зарекомендовал себя в интернете. Просто и изящно.

Внедрение PageRank совершило настоящую революцию в зарождающейся отрасли поисковых систем. Буквально за считанные месяцы все конкуренты создали аналогичные системы ранжирования. Со временем аналоги PageRank эволюционировали в нечто гораздо более сложное, где учитывалось множество факторов — вплоть до местоположения пользователя. Но об этом чуть позже.

MatrixNet от Яндекса: машинное обучение раньше всех

Кстати, поиск от Яндекса и сама компания в целом были важными первопроходцами в индустрии. Разработчики Яндекса буквально первыми стали использовать машинное обучение в поиске, когда Google ещё даже не задумывался об этом.

В 2009 году Яндекс сделал важный шаг в развитии поисковых технологий, начав использовать машинное обучение (ML — Machine Learning) значительно раньше Google. Компания разработала собственную технологию под названием MatrixNet, которая совершила настоящий прорыв в области поисковых систем.

К тому моменту интернет уже был огромным, и по некоторым запросам находились миллионы страниц. Просто показать все сайты, содержащие слова из запроса, было уже недостаточно — ведь пользователю пришлось бы целую вечность листать страницы с результатами. Требовалось научиться определять, какие страницы действительно отвечают на вопрос пользователя.

Для этого поисковик анализировал множество факторов: как часто встречаются слова из запроса, сколько на сайт ведёт ссылок, насколько он популярен у пользователей, и так далее. Всего таких факторов были тысячи, и первоначально они отслеживались вручную. Специалисты-эксперты — так называемые асессоры — помогали системе учиться, оценивая качество результатов поиска. Они оценивали конкретные страницы по конкретным запросам, и затем на этих оценках обучалась формула, которая ранжировала сайты по любому запросу.

Главная особенность MatrixNet заключалась в том, что он мог автоматически работать с огромным количеством таких факторов и при этом не переобучаться. То есть формула ранжирования сайтов стала подбираться на основании всех известных факторов и знаний о том, какие страницы лучше соответствуют запросу, а какие — хуже. Обычные алгоритмы в подобной ситуации начинали находить несуществующие закономерности, а MatrixNet оставался точным.

Более того, сама система могла настраивать поиск для разного типа запросов. Например, можно было улучшить поиск по музыке, не испортив при этом поиск по другим темам. А ещё MatrixNet был невероятно быстрым: он успевал проверить все факторы за доли секунды. Всё это работало на тысячах серверов одновременно — каждый искал по своей части интернета, находил лучшие результаты, а потом они объединялись в единый список, и пользователь практически мгновенно получал именно те сайты, которые ему были нужны.

Эта технология стала важнейшим шагом в развитии поиска. Она позволила учитывать намного больше факторов, чем раньше, и при этом делать это точно. С появлением MatrixNet поиск стал значительно умнее — он начал гораздо лучше понимать, чего хочет пользователь.

Самое забавное: технология настолько опередила своё время, что инженерам Яндекса пришлось сооружать инсталляцию из водяных труб, чтобы наглядно объяснить журналистам, что такое машинное обучение.

Три кита поиска прошлого

Подведём итог «поиска вчера» и назовём три главных кита, на которых он держится:

  1. Индексирование веб-страниц — создание своеобразной картотеки всего интернета.
  2. Настройка релевантности поиска — по типу PageRank от Google.
  3. Машинное обучение — впервые полноценно применённое Яндексом в 2009 году.

Поиск сегодня: от тысяч факторов до нейросетей

Нынешние поисковые системы эволюционировали в совершенно невероятные сервисы, которыми мы пользуемся каждый день. Когда компании осознали, что на продаже рекламы на самых посещаемых ресурсах интернета можно прекрасно зарабатывать, организации, которые изначально просто занимались поиском веб-страниц, превратились в настоящих технологических гигантов. Достаточно посмотреть на Google или Яндекс и оценить, в скольких сферах они присутствуют сегодня.

С расширением интернета стало очевидно, что искать нужно не только сайты, но и отдельные видеоролики, изображения, рестораны, природные локации и многое другое. Работы меньше не стало — интернет за последние десятилетия вырос многократно.

Предугадывание запросов

Например, чтобы ускорить поиск информации, появилась функция угадывания запроса пользователя. Специальный алгоритм запоминал, к какому слову привязана самая частая продолжающая связка — с учётом местоположения пользователя, самых частых запросов и множества других факторов. Если человек начинает вводить запрос «кто такой», поисковик мгновенно предлагает несколько вариантов продолжения. Попробуйте проверить это сами — результаты могут удивить.

От единиц к тысячам факторов

По сути, все технологии из «поиска вчера» перекочевали в «поиск сегодня», но на совершенно иных мощностях. Если раньше использовались лишь несколько метрик (вспомните PageRank от Google), то сегодня поисковики оперируют тысячами факторов ранжирования. Давным-давно для присвоения статуса полезности нужна была всего одна метрика — цитируемость ссылки. Теперь же алгоритмы анализируют колоссальное число параметров. MatrixNet от Яндекса, о котором мы уже рассказали, в своё время был именно таким исключением — он опережал эпоху.

Администрировать эти тысячи факторов вручную, естественно, невозможно. И тут на помощь приходит машинное обучение.

RankBrain от Google: поиск вещей, а не строк

Нейросети прочно вошли в нашу жизнь. С их помощью мы генерируем изображения, создаём видео, пишем тексты. И революция, которая происходит вокруг нас сейчас, стала возможной в том числе благодаря поиску в интернете. Ведь прародителями современных нейросетей с начала 2010-х годов стало именно машинное обучение.

Google тоже не стоял на месте. В 2015 году компания представила технологию RankBrain, и поисковик научился искать вещи, а не строки.

Чтобы обучить алгоритмы, инженеры Google сначала «скармливали» ему данные из различных источников, чтобы он начал их сопоставлять и упорядочивать выдачу на основе этих вычислений. Затем RankBrain наблюдал, как пользователи взаимодействуют с результатами поиска, созданными при помощи машинного обучения. Если пользователи оставались довольны результатами, алгоритм продолжал работать в том же направлении. Если результат не устраивал — машина начинала процесс заново.

RankBrain также оценивал релевантность контента на странице. Речь шла не только о сопоставлении ключевых слов, но и о глубоком понимании контекста. Он мог различать фрагменты, которые затрагивают разные аспекты и подтемы, связанные с основной темой запроса.

В целом, RankBrain выполнял две основные задачи. Во-первых, учился понимать поисковые запросы — их смысл и ключевые слова на веб-страницах. Во-вторых, измерял удовлетворённость пользователя результатами и подстраивался соответственно.

Нейросети-трансформеры: поиск по смыслу

Внедрение машинного обучения многократно улучшило опыт поиска. Он стал значительно персонализированнее и намного умнее. Именно благодаря нейросетям нового типа — так называемым нейросетям-трансформерам — и Google, и Яндекс научились понимать смысл запроса, а не просто искать совпадения слов.

Например, сегодня можно написать в поисковой строке «фильм, где мужчина выращивает картошку на Марсе», и вы получите множество релевантных ссылок с правильным ответом — фильм «Марсианин». Всё это происходит потому, что поисковик понимает смысл запроса, а не просто ищет ключевые слова на страницах.

Поиск завтра: эра искусственного интеллекта

Однако всё вышесказанное — лишь часть картины. Речь не только о машинном обучении. За последние несколько лет произошла настоящая революция — появились чатботы на основе больших языковых моделей.

На самом деле поиск будущего уже среди нас, и его можно смело назвать поиском настоящего. Это третий этап в развитии интернета и в поведении пользователей. Теперь в интернете есть все и всё: бизнес, инвестиции, сильные команды и продукты. Сейчас недостаточно просто находить актуальную информацию быстро. Теперь важно быстро находить самое лучшее из всего существующего контента.

У чатбота можно узнать практически что угодно, причём максимально персонализированно. В последний год компании массово внедряют чатботов в свои поисковые системы.

Экзистенциальный кризис поисковиков

Любопытно, что когда чатботы только начали появляться, поисковые компании пережили своего рода экзистенциальный кризис. Google вообще ввёл «красный код» внутри компании и стал считать ChatGPT своей главной угрозой. Однако спустя время стала очевидна одна крайне важная вещь: чатботы ошибаются. Причём не просто ошибаются, а порой галлюцинируют — выдумывают факты, которых не существует в реальности.

Простыми словами, чатбот, который должен был стать абсолютным поиском, оказался неспособен в одиночку справиться с этой задачей. Однако решение проблемы нашлось: объединить чатбота и поисковую систему.

Симбиоз: чатбот + поисковая система

Выгода от подобного симбиоза получается превосходная. Чатбот естественным языком отвечает на поставленный вопрос, превосходя все алгоритмы прошлого в десятки раз. С ним можно просто разговаривать как с человеком, и нет необходимости переходить по множеству ссылок, потому что вся информация суммируется сразу в один готовый ответ. А технологии поиска, в свою очередь, помогают чатботу находить достоверную и актуальную информацию, подкрепляя ответ релевантными ссылками на источники.

Copilot от Microsoft

Одним из первых представителей такого подхода стал Copilot от Microsoft. Компания инвестировала миллиарды долларов в OpenAI и встроила в свой поисковик Bing на тот момент самый мощный чатбот в истории — GPT-4 Turbo. То есть технология поиска работала совместно с чатботом, чтобы выдать максимально персонализированный результат.

Google AI Overviews и Gemini

Google же решила подойти к проблеме более фундаментально. В мае 2024 года компания представила собственную модель Gemini, специально адаптированную для поиска. Система получила название AI Overviews и работает через так называемые «ИИ-обзоры».

Когда пользователь задаёт вопрос, Gemini не просто ищет информацию, но анализирует её, структурирует и представляет в удобном формате. При этом система всегда указывает источники информации, позволяя пользователю проверить данные.

Одна из самых интересных возможностей — анализ видео для поиска решения технических проблем. Например, если у вас сломался проигрыватель виниловых пластинок, достаточно снять короткое видео проблемы, и система поможет найти решение.

Google также анонсировала системы, которые не только помогают с поиском, но и выполняют действия за пользователя. Например, можно написать: «Купи билет из Москвы в Стамбул», и нейросеть самостоятельно оформит покупку.

SearchGPT от OpenAI

Не остаётся в стороне и сама компания OpenAI. В конце 2024 года она представила собственный поисковик SearchGPT (впоследствии интегрированный в ChatGPT как функция поиска). Он объединяет возможности языковой модели GPT-4o с прямым доступом к актуальной информации из интернета.

SearchGPT работает принципиально иначе, нежели привычные поисковики. Когда вы задаёте вопрос, система не просто выдаёт список ссылок, а сразу формирует подробный ответ, основанный на данных из различных источников. При этом каждый факт в ответе сопровождается ссылкой на первоисточник — будь то новостная статья, научная публикация или специализированный блог.

В SearchGPT также появились специальные визуальные форматы для определённых типов запросов. Например, при поиске погоды пользователь видит детальный прогноз с графиками. При запросе котировок — биржевые данные в реальном времени. Для спортивных событий — актуальное расписание матчей и результаты.

Однако подобные решения, разумеется, есть и у других игроков рынка. И в этом отношении OpenAI пока остаётся в роли догоняющего. Главное преимущество SearchGPT — это возможность вести полноценный диалог: можно задавать уточняющие вопросы, и система будет учитывать контекст всего разговора.

Яндекс и поиск с Нейро

Отечественные разработчики тоже не отстают. В октябре 2024 года Яндекс представил масштабное обновление своего поисковика, интегрировав в него технологию Нейро. Поиск с Нейро работает по той же модели: он сразу даёт ответ на вопрос, ссылаясь на источники в интернете. Система автоматически определяет, когда её помощь будет действительно полезна, и появляется в результатах поиска самостоятельно. Если же нейросетевой ответ не был показан автоматически, достаточно нажать на специальную кнопку под поисковой строкой.

Поиск с Нейро умеет работать со сложными составными вопросами, и с ним можно вести полноценный диалог, поскольку он понимает контекст. Например, вы можете спросить: «Какая сегодня ключевая ставка?» А потом просто уточнить: «А когда изменится?» И поиск ответит датой следующего заседания Центрального банка. Раньше для этого пришлось бы делать два полноценных независимых поисковых запроса.

Кроме того, система научилась работать и с изображениями. В поиске по картинкам или через умную камеру можно задавать вопросы о конкретных деталях на фотографии. Сфотографировали автомобиль — и просто спросили, сколько он стоит. Не нужно знать марку и модель: вы сразу получаете готовый ответ. А если на фотографии рядом с основным объектом присутствует другой предмет — например, велосипед — поиск поймёт контекст и всё равно ответит именно про автомобиль.

Более того, можно сфотографировать задачу по математике для девятого класса, и поиск самостоятельно её решит — даже если такой задачи нет в интернете. (Простите за это опасное знание.)

Поиск завтрашнего дня: AGI и абсолютная персонализация

Всё описанное выше — это поиск сегодня, и мы уже живём с ним бок о бок. Но что ждёт нас в будущем?

По прогнозам экспертов, в ближайшее время поиск сможет давать ответы на основе не только текстовой, но вообще любой информации в интернете — например, на основе содержимого конкретного видеоролика.

Однако использование нейросетей в связке с поиском — это, по всей видимости, промежуточный вариант. Настоящий поиск будущего должен быть связан с AGI — Artificial General Intelligence, то есть так называемым «настоящим» искусственным интеллектом. Не просто алгоритмом, который пытается угадать, что хочет пользователь, а полноценным цифровым разумом, способным мыслить и понимать.

Только представьте, насколько поиск станет совершеннее, когда у вас появится собственный ассистент, который знает вас лучше, чем кто-либо другой, и способен буквально по первым нескольким буквам угадать, что вам нужно. А с учётом того, как стремительно всё развивается в 2025 году, подобный поиск мы, возможно, увидим достаточно скоро.

Судите сами: нынешние технологии уже умеют искать по тексту и изображениям, вести с пользователем полноценный диалог, а персонализированный ИИ-ассистент сможет делать всё это индивидуально для каждого.

Персонализация — вот главная черта поиска будущего, если всё пойдёт так, как предрекают лидеры индустрии.

Заключение

История интернет-поиска — это история человеческого стремления к знаниям. От бумажных каталогов и примитивного Archie в 1990 году — через революцию PageRank и MatrixNet — к нейросетевым ассистентам, которые разговаривают с нами на естественном языке. Каждый этап этой эволюции делал доступ к информации проще, быстрее и точнее.

Сегодня мы стоим на пороге новой эпохи, в которой границы между поисковой системой и интеллектуальным собеседником окончательно стираются. И если прошлое научило нас чему-то, то это тому, что следующий скачок может произойти быстрее, чем кто-либо из нас ожидает

 

Почему память дорожает и будет ли хуже: ИИ против ваших гаджетов

Почему дорожают SSD, ОЗУ и смартфоны в 2026 году. ИИ съедает мировое производство памяти: HBM, стена памяти, FlashAttention и когда ждать облегчения.
Павел Ельцов 17 мая 2026 в 12:30

2017 год: биткоин взлетает, майнеры скупают видеокарты, цены удваиваются. 2020 год: пандемия, заводы стоят, чипов не хватает никому. 2026 год: SSD на терабайт, который стоил 50 долларов, — уже 110, и ещё поди найди. Цены на оперативную память выросли больше чем вдвое за прошлый год. Каждый раз казалось: переживём, рассосётся. Крипта обвалилась — цены вернулись. Пандемия ушла — цены вернулись. Но на этот раз виновник никуда не уходит.

Статья 1995 года, которую никто не читал

За окном 1995 год. Интернет ещё по модему. Windows 95 только вышла. И вот в это время два исследователя из Виргинского университета — Уильям Вулф и Сали Маки — публикуют статью с названием, которое звучит почти как издёвка: «Удар о стену памяти: последствия очевидного». Мол, ребята, всё на поверхности, посмотрите на графики.

Графики показывали вот что. Скорость процессоров и скорость памяти растут одновременно — обе экспоненциально. Но экспоненты разные. Процессоры в те годы ускорялись примерно на 60–80% в год, а память — всего на 7%. Обе кривые ползут вверх, только одна — как ракета, другая — как улитка. И Вулф с Маки указали на принципиальный момент: разница между двумя расходящимися экспонентами сама растёт экспоненциально.

То есть со временем разрыв не сглаживается — он ускоряется. Рассуждение было простым. Допустим, процессор находит нужные данные в быстром кэше в 99 случаях из ста. Звучит отлично. Но оставшийся один процент нужно тянуть из основной оперативной памяти, которая медленнее в десятки раз. Если каждое такое обращение стоит процессору хотя бы пять тактов ожидания, производительность катастрофически проседает. Неважно, насколько быстрый процессор — он просто сидит и ждёт данные. Как курьер с едой: кухня готовит за три минуты, а лифт в двадцатиэтажном доме едет пятнадцать. Повар уже свободен, еда стынет, а курьер стоит. Скорость доставки определяется не скоростью готовки, а скоростью лифта.

Вулф и Маки подсчитали: даже при фантастическом показателе попаданий в кэш на уровне 99,8% стена будет достигнута через 11–12 лет — примерно к 2007 году. Индустрия, конечно, не стояла на месте. Инженеры придумали многоуровневую кэш-память L1, L2, L3, предсказатели ветвлений, которые угадывали нужные данные и подгружали их заранее, внеочередное исполнение команд — когда процессор, вместо ожидания застрявшей операции, переключается на другую задачу. Десятки умных трюков, чтобы процессор как можно реже обращался в медленную память. И это работало. Стену удалось не разрушить, но отодвинуть. А потом пришёл искусственный интеллект.

Почему нейросети убивают все трюки, накопленные за 30 лет

Классические программы — те, которые мы использовали десятилетиями, — работают с относительно небольшими кусками данных. Они часто возвращаются к одним и тем же участкам памяти: загрузил, посчитал, снова обратился к тому же. Кэш с этим справляется отлично — он как раз хранит то, к чему часто обращаются. Нейросети устроены принципиально иначе. Им нужно протащить через процессор гигабайты параметров — десятки миллиардов чисел — причём последовательно, слой за слоем. Один раз загрузил, использовал, выкинул, загрузил следующий. Кэш здесь бесполезен: данных слишком много, они попросту не помещаются. И каждый раз приходится обращаться в основную память — ту самую медленную.

Все трюки, которые индустрия копила тридцать лет, — кэши, предсказатели, переупорядочивание операций — разом перестали спасать. Нейросети их обнулили. Чтобы понять, почему проблема настолько глубока, нужно вернуться к самим корням.

В 1945 году математик Джон фон Нейман описал архитектуру, по которой до сих пор работают практически все компьютеры на планете. Идея простая: есть процессор, который считает, и есть память, которая хранит данные и инструкции. Между ними — шина, по которой информация передаётся туда и обратно. В 1945 году это было откровением: универсальная машина вместо десятков специализированных, компьютер, который можно перепрограммировать, не перепаивая провода. Но есть принципиальный изъян. Всё проходит через одну шину. Один мост через реку, по которому в обе стороны едут грузовики. Пока машин мало — проблемы нет. Но когда процессор научился считать в сотни раз быстрее, чем память отдаёт ему данные, мост встал в пробку. Для обычных задач терпимо, но для искусственного интеллекта, который непрерывно ворочает миллиарды параметров, — неприемлемо.

Так что пророчество Вулфа и Маки сбылось — только не совсем так, как ожидалось. Не через двенадцать лет, а через тридцать. И не из-за обычных программ, а из-за нейросетей, которых в 1995 году толком не существовало. Стена, залатанная синей изолентой из кэшей и умных алгоритмов, всё-таки не выдержала. Просто понадобился достаточно сильный удар.

Что происходит внутри нейросети: миллиарды чисел и проблема внимания

Любая нейросеть — это набор параметров, проще говоря, чисел. Когда вы слышите «модель на 70 миллиардов параметров», это буквально означает 70 миллиардов чисел, каждое из которых нужно хранить в памяти. Эти числа называют весами модели, и они — результат обучения. В них закодировано всё знание нейросети: грамматика, логика, факты, способность рассуждать.

Сколько это в гигабайтах? Зависит от формата хранения. В стандартном формате FP16 (половинная точность, два байта на число) модель на 70 миллиардов параметров весит 140 гигабайт. Для сравнения: топовая потребительская видеокарта Nvidia RTX 4090 имеет 24 гигабайта видеопамяти. Модель на 70 миллиардов параметров туда не влезет даже теоретически — нужно минимум шесть таких карт. И это только чтобы модель поместилась, без учёта всего остального. А остальное — самое интересное.

Все современные большие языковые модели — GPT, Claude, Gemini — построены на архитектуре, которую называют трансформером. Её придумали в 2017 году инженеры Google, и с тех пор она стала стандартом отрасли. Ключевой механизм трансформера — так называемое внимание (attention). Представьте, что вы читаете длинное предложение. Чтобы понять смысл каждого слова, нужно учитывать контекст — все остальные слова вокруг. «Замок» означает разное в «дверной замок» и «средневековый замок» — вы это понимаете, потому что смотрите на соседние слова. Механизм внимания делает ровно то же самое, только математически.

Каждый элемент текста — токен — смотрит на все остальные токены, чтобы понять контекст. Для этого модель создаёт три матрицы: Query («что я ищу»), Key («что здесь есть») и Value («какая информация мне нужна»). Перемножение Query на Key даёт матрицу внимания — таблицу, где для каждой пары токенов записано, насколько они связаны друг с другом. И вот здесь начинается проблема.

Размер этой таблицы пропорционален квадрату длины контекста. При контексте в 2 000 токенов — примерно небольшой рассказ — матрица содержит 4 миллиона элементов. Ерунда, влезает в кэш процессора. Но возьмём модель с контекстом 128 000 токенов — это целая книга. Матрица внимания вырастает до 16 миллиардов элементов: 32 гигабайта для одного слоя, а слоёв в модели — десятки. Вот ключевая закономерность: удвоили контекст — получили не двойной, а четырёхкратный рост потребления памяти. Это квадратичная зависимость.

Есть ещё один механизм, о котором знают в основном инженеры, но именно он часто становится главным пожирателем памяти. Когда языковая модель генерирует текст, она выдаёт по одному слову за раз. Для каждого нового слова ей нужно обратиться ко всему предыдущему контексту разговора. Пересчитывать всё с нуля каждый раз было бы безумно дорого. Поэтому модель запоминает промежуточные результаты — ключевые матрицы для всех предыдущих токенов. Эту «шпаргалку» называют KV-кэшем (Key-Value cache). И вот этот кэш растёт линейно с длиной контекста и числом одновременных пользователей.

Возьмём конкретные числа. Для модели Llama 70B при контексте 128 000 токенов и одновременном обслуживании 32 пользователей KV-кэш пожирает больше терабайта памяти. Даже со специальными методами сжатия — около 640 гигабайт. Только на «шпаргалку». Веса модели — 140 гигабайт, а кэш — от 640 до 1 300 гигабайт. Шпаргалка оказалась в несколько раз тяжелее учебника.

Чтобы выдать одно слово ответа, модели нужно загрузить из памяти все свои веса — все 140 гигабайт — прогнать через них данные, получить результат и для следующего слова загрузить все 140 гигабайт снова. Каждый токен требует полной загрузки весов модели из памяти. Скорость этой загрузки определяется пропускной способностью памяти. На видеокарте Nvidia H100 — одном из самых мощных ИИ-ускорителей — память отдаёт данные со скоростью 3 350 гигабайт в секунду. Делим 3 350 на 140 — получаем теоретический максимум примерно 24 токена в секунду. Этот потолок определяется не скоростью вычислений: процессорные ядра H100 могут считать гораздо быстрее. Потолок определяется тем, как быстро память отдаёт данные.

Видео — это уже совсем другой масштаб катастрофы

Текст — самая лёгкая модальность для ИИ. Возьмём видео. Одна секунда ролика в 720p — это 30 кадров. Каждый кадр — почти миллион пикселей. Каждый пиксель — три цветовых канала. Одна секунда видео содержит информации больше, чем целая книга в текстовых токенах.

Инженеры идут на хитрость: видео сначала сжимают в так называемое латентное пространство — примерно в сто раз. Представьте, что вы берёте детальную фотографию и превращаете её в грубый набросок, из которого можно восстановить оригинал. С этим наброском и работает нейросеть. Но даже после стократного сжатия пятисекундный ролик в 720p — это больше 80 000 токенов. А квадратичная зависимость внимания при 80 000 токенов означает матрицу из 6,4 миллиарда элементов только для одного слоя. И слоёв — десятки.

Конкретные цифры. Модель Stable Diffusion Video генерирует всего 14 кадров — меньше полсекунды видео. При разрешении 576 × 1024 пикселя она потребляет 39,5 гигабайта пиковой памяти. Генерация статичной картинки того же разрешения — 6,3 гигабайта. Рост в шесть раз, и это за жалкие полсекунды. Обучение модели уровня Sora обходится свыше 100 миллионов долларов при использовании более шести тысяч видеокарт одновременно. И значительная часть стоимости — это память. Генерация видео в 4К без предварительного сжатия потребовала бы примерно в 130 раз больше памяти, чем при разрешении 256 × 256 пикселей.

А на горизонте — мультимодальные модели, которые одновременно обрабатывают текст, картинки, видео, звук, трёхмерные данные. Контекстные окна за пять лет выросли с 2 000 токенов у GPT-3 до 10 миллионов у Llama 4 Scout — рост почти в пять тысяч раз. Каждый шаг к мультимодальности, каждый новый тип данных, каждое увеличение контекста — это новый порядок потребления памяти. И каждый раз система упирается всё в ту же стену.

HBM: почему обычная оперативка не справляется

Стандартный модуль DDR5, который стоит в вашем компьютере, выдаёт около 64 гигабайт данных в секунду. Для офисных задач, игр и даже видеомонтажа — более чем достаточно. Но чтобы модель Llama 70B сгенерировала хотя бы 24 слова в секунду, память должна отдавать 3 350 гигабайт в секунду. DDR5 медленнее в пятьдесят с лишним раз. На ней модель будет выдавать меньше одного слова за две секунды.

Решение называется HBM — High Bandwidth Memory, память с высокой пропускной способностью. Чтобы понять её устройство, представьте обычную оперативную память как одноэтажный склад: широкий, просторный, но данные вывозятся через одни ворота. HBM — это многоэтажный склад с идеальной логистикой: восемь или двенадцать этажей, буквально уложенных один над другим, соединены тысячами грузовых лифтов. Данные едут одновременно со всех этажей.

Технически это восемь-двенадцать кристаллов обычной памяти, уложенных друг на друга. Каждый кристалл — тончайшая кремниевая пластинка. Они соединены тысячами микроскопических вертикальных контактов, пронизывающих все слои насквозь. Их называют TSV — Through-Silicon Vias, сквозные кремниевые переходы. Это и есть те самые лифты. Ширина шины данных у HBM — 1024 бита; у DDR5 — 64 бита.

Шестнадцатикратная разница. При этом каждый отдельный бит бежит по шине HBM медленнее, чем в GDDR. Но если GDDR — скоростная однополосная трасса, то HBM — шестнадцатиполосная магистраль. Один стек HBM3E выдаёт скорость больше 1 200 гигабайт в секунду. Nvidia H200 несёт шесть стеков HBM3E — суммарная пропускная способность превышает 4 800 гигабайт в секунду.

Но есть одна принципиальная сложность. Нельзя просто взять HBM и припаять к видеокарте: стандартные дорожки на печатной плате слишком грубые для тысяч микроскопических контактов. Нужен специальный промежуточный слой — кремниевый интерпозер, на котором рядом размещаются GPU и стеки HBM. Технология, по которой это делается, называется CoWoS (Chip on Wafer on Substrate), и практически полностью принадлежит TSMC. Можно произвести сколько угодно GPU и HBM по отдельности — без упаковки CoWoS они бесполезны, как двигатель и колёса без шасси. Nvidia зарезервировала больше 60% всех мощностей CoWoS до конца 2026 года.

Три компании против всего мира: дефицит, который не закончится

HBM производят всего три компании в мире. SK Hynix — южнокорейский гигант, контролирует около 60% рынка. Micron и Samsung делят оставшееся, при этом Samsung долгое время отставал из-за проблем с качеством при квалификации HBM3E у Nvidia. Сейчас он восстанавливает позиции и уже первым в мире начал коммерческие поставки HBM4.

Все три производителя заявили, что их продукция HBM полностью распродана до конца 2026 года. В апреле 2026 года Samsung предупредила инвесторов о «значительном дефиците» по всем видам памяти минимум до 2027 года. Это зеркально повторяет слова SK Hynix, произнесённые неделей ранее. Когда два из трёх крупнейших производителей памяти одновременно предупреждают о многолетнем дефиците — это не квартальная флуктуация.

Рынок HBM растёт стремительно: по оценкам аналитиков, с 35 миллиардов долларов в 2025 году до 100 миллиардов к 2028-му. HBM уже потребляет 23% всего мирового производства пластин для DRAM — против 19% в 2025-м. Производство одного бита HBM требует примерно в три раза больше мощностей пластинного производства, чем обычная DDR5. Это означает: каждый гигабайт HBM, произведённый для нужд ИИ-кластера, — это три гигабайта обычной памяти, которые не попали на потребительский рынок.

В итоге весь мировой ИИ висит на острове в 180 километрах от Китая — Тайване, где расположена TSMC с монополией на CoWoS, — и на полуострове рядом с Северной Кореей, где сосредоточены заводы Samsung и SK Hynix.

Почему дорожает ваш ноутбук, смартфон и SSD

Производство памяти — замкнутая система. Чистые комнаты, в которых делают чипы, стоят миллиарды. Новая фабрика строится три-пять лет. Оборудование для литографии — штучный товар, его производят буквально несколько компаний на планете. Нельзя просто щёлкнуть пальцами и удвоить выпуск.

Samsung и SK Hynix перенаправили до 40% своих мощностей под HBM. Почему? Маржинальность. Один стек HBM3E приносит в пять-десять раз больше прибыли, чем горсть модулей DDR5 для потребительского рынка. Если вы директор завода и можете продать одну и ту же пластину кремния в виде обычной памяти или в пять-десять раз дороже в виде HBM — что вы выберете?

Дальше — чистая арифметика. По данным IDC, цены на DRAM выросли примерно в два с половиной раза только за 2025 год. DRAM-цены в первом квартале 2026 года прибавили ещё 90% по сравнению с четвёртым кварталом 2025-го — это «беспрецедентный» рост, по словам аналитика TrendForce. Стоимость чипов NAND, основы любого SSD, выросла с 4 до 10 долларов за чип за несколько месяцев — то есть более чем вдвое. Потребительские SSD на терабайт, которые в 2023 году стоили 50 долларов, сегодня стоят 110 и выше.

Как это бьёт по конкретным рынкам? В среднем сегменте память составляет 15–20% себестоимости смартфона. Когда память дорожает на десятки процентов, производителям некуда девать эту разницу, кроме как переложить на покупателя. По прогнозам, рынок смартфонов сократится на 12,9% в 2026 году, рынок ПК — на 11,3%. Средняя цена смартфона достигнет исторического максимума. Lenovo, Dell, HP, Asus и Acer уже предупредили клиентов о повышении цен на 15–20%.

Apple и Samsung пострадают меньше — у них и резервы побольше, и долгосрочные контракты с поставщиками памяти, заключённые на несколько лет вперёд. Micron и вовсе свернул потребительский бренд Crucial, полностью переориентировались на корпоративных и ИИ-заказчиков. Lenovo описал происходящее как «беспрецедентный» рост затрат.

Это не циклический дефицит, не сезонная флуктуация, которая сама рассосётся. Вспомните криптобум 2017–2018: видеокарты подорожали вдвое-втрое, потому что майнеры скупали всё подряд. Но когда крипта рухнула — цены вернулись. Ковидный дефицит 2020–2021: из-за сбоев логистики нельзя было купить ни консоль, ни ноутбук. Пандемия прошла — рынок выровнялся. Но сейчас совсем другая история.

Гиперскейлеры — Microsoft, Amazon, Google — заключают многолетние контракты на поставку памяти. Они забирают ёмкости не на квартал и не на год, а на несколько лет вперёд. IDC называет происходящее не циклическим дефицитом, а «потенциально перманентным стратегическим перераспределением мирового кремния».

Как инженеры штурмуют стену: три атаки со стороны программ

Если вы думаете, что индустрия сидит сложа руки, — вы плохо знаете инженеров. Атака идёт с двух сторон: программисты учат модели обходиться меньшим количеством памяти, а разработчики железа перестраивают саму архитектуру чипов.

Первый программный подход. Помните матрицу внимания, которая растёт квадратично с длиной контекста? В 2022 году аспирант Стэнфорда Три Дао задал неочевидный вопрос: зачем вообще собирать эту огромную таблицу целиком? Представьте, что вам нужно сложить гигантский пазл, но стол слишком маленький. Стандартный подход — найти стол побольше. Подход Дао — собирать по частям: берёте фрагмент, собираете на маленьком столе, запоминаете результат, убираете, берёте следующий. Технически алгоритм FlashAttention нарезает данные на блоки, которые помещаются в быструю кэш-память прямо на чипе. Каждый блок обрабатывается локально, в медленную основную память ничего не записывается вообще. Обращений к памяти в девять раз меньше, скорость в два-четыре раза выше. Именно благодаря FlashAttention контекстные окна моделей смогли вырасти до сотен тысяч токенов.

Второй подход — квантование. Каждый параметр модели — число с кучей знаков после запятой. Квантование — это, по сути, округление. Переход от стандартного формата FP16 к INT4 сжимает модель в восемь раз. Llama 70B влезает в 35 гигабайт вместо 140. Цена: для небольших моделей на сложных логических задачах точность может проседать на 8–14%. Крупные модели переносят квантование гораздо легче — потери составляют всего 1–3%. Но в задачах, где важна каждая доля процента — например, в медицинской диагностике — даже такая разница имеет значение.

Третий, самый смелый подход — вопрос: а что, если проблема не в памяти, а в самой архитектуре трансформера? В 2023 году появилась архитектура Mamba, построенная на совершенно другом фундаменте. Она вообще не строит квадратичную матрицу внимания, а обрабатывает текст последовательно, храня компактное состояние разговора. Расход памяти постоянный — хоть тысяча токенов, хоть миллион. Пока это нишевое решение, но оно может изменить правила игры.

Как инженеры штурмуют стену: три атаки со стороны железа

Представьте повара, у которого кухня на втором этаже, а холодильник в подвале. Духовка уже раскалилась, сковородка готова — а он бегает по лестнице за каждым ингредиентом. Вот так выглядит современный процессор, ожидающий данные из памяти.

Первое решение — перенести холодильник на кухню. Технология Processing-in-Memory встраивает вычислительные блоки прямо в чипы памяти. Данные обрабатываются там, где лежат, никуда не путешествуя. Samsung уже продемонстрировал рабочие прототипы. Второе решение — сделать к холодильнику скоростной лифт. Технология CXL (Compute Express Link) объединяет память нескольких серверов в общий пул. Немного медленнее локальной памяти, зато ёмкость вдвое-вчетверо больше — GPU перестают простаивать в ожидании данных. Google 24 марта 2026 года анонсировала TurboQuant — собственную технологию сжатия памяти для языковых моделей, которая даёт шестикратное снижение потребления памяти при инференсе на H100.

Третье решение — заменить сами провода. Медные соединения на высоких скоростях теряют сигнал катастрофически. Оптические интерконнекты передают данные фотонами — без потерь и нагрева. По прогнозам, к 2028 году без оптики будет просто не обойтись: требования к скорости связи между чипами перешагнут 50 терабайт в секунду.

Каждое из этих решений бьёт в свой участок стены. Вместе они её расшатывают — но пока не пробивают. Новые мощности от Micron и SK Hynix достигнут серийного объёма не раньше 2027–2028 годов. До тех пор структурный разрыв между спросом и предложением сохранится.

Стена стоит. Что дальше?

В 1995 году Вулф и Маки озаглавили свою статью «Последствия очевидного». Ирония в том, что очевидное — самая незаметная вещь на свете. Крипта обвалилась — цены вернулись. Пандемия ушла — цены вернулись. Мы привыкли, что дефициты рассасываются.

Но ИИ растёт, и каждое следующее поколение требует больше памяти, чем предыдущее. Это новая реальность, в которой память становится стратегическим ресурсом. Дешёвые гигабайты закончились не потому, что кто-то что-то сломал или захотел нажиться. Они закончились потому, что самая трансформирующая технология поколения голодна — и сам механизм встроен в её математику, в квадратичный рост матриц внимания, в необходимость каждый раз загружать из памяти сотни гигабайт весов.

Тот, кто разрушит стену памяти, изменит мир не меньше, чем те, кто придумал транзистор. Пока стена стоит. И пока она стоит — ваш следующий ноутбук, смартфон или SSD будет дороже, чем предыдущий.

Samsung Galaxy S26: ИИ вместо лошадиных сил

Samsung Galaxy S26 поступил в продажу — первый флагман, где железо подчинено нейросети. Galaxy AI, Privacy Display и профессиональный кодек APV.
Павел Ельцов 26 марта 2026 в 03:39

Samsung Galaxy S26 поступил в продажу 11 марта — и это первый флагман, где железо открыто подчинено нейросети. Президент мобильного подразделения Те Мун Ро заявил: отныне серьёзное обновление «железа» происходит только тогда, когда оно даёт прирост Galaxy AI. Мощность ради мощности — в прошлом.

Технически это означает, что каждый нейронный блок в чипе Snapdragon 8 Elite Gen 5 заточен под конкретные ИИ-задачи. В числе новинок — функция Privacy Display с адаптивной поляризацией экрана и поддержка профессионального видеокодека APV, который впервые появляется в мобильном устройстве. Android-мир делает шаг туда, куда Apple пришла чуть раньше.

Nvidia покупает чужой мозг за $20 миллиардов

Nvidia лицензирует архитектуру Groq за $20 млрд для нового ИИ-чипа. Признание: LPU от Groq быстрее собственных решений Nvidia в задачах вывода.

Nvidia готовится показать принципиально новый для себя тип чипа — процессор для вывода нейросетевых моделей, построенный не на собственной архитектуре, а на разработках стартапа Groq. Два года назад Groq почти никто не знал, но их языковой процессор (LPU) оказался лучшим на рынке для задач инференса. Nvidia оценила это и заключила лицензионное соглашение на внушительные $20 млрд.

Для компании, привыкшей диктовать архитектурные стандарты в одиночку, это неожиданный шаг. Фактически Nvidia признаёт: в гонке за скоростью вывода ИИ чужое решение оказалось быстрее собственного. Новый чип ожидается к показу в марте — и индустрия следит внимательно.

Почему китайские смартфоны снимают лучше iPhone: вычислительная оптика, диффузионные модели и конец эпохи A-брендов

Почему китайские смартфоны снимают лучше iPhone? Разбираем алгоритмы Vivo, диффузионные модели BokehDiff и революцию в мобильной фотографии.
Павел Ельцов 18 марта 2026 в 10:38

Последние несколько лет с камерами в смартфонах происходит нечто странное. Устоявшиеся лидеры рынка — Apple, Google, Samsung — словно застряли на месте. Каждое новое поколение приносит косметические улучшения: чуть больше мегапикселей, чуть точнее автофокус, чуть лучше ночной режим. Но прорыва, сопоставимого с тем, что когда-то совершил портретный режим или ночная съёмка на Pixel, не было уже давно.

А вот китайские производители — Vivo, OPPO, Xiaomi, Huawei — за тот же период совершили колоссальный рывок. Они больше не догоняют западных и корейских конкурентов. Они задают тренды.

Возникает закономерный вопрос: что происходит? Почему китайские компании так резко вырвались вперёд? Что они делают принципиально иначе? И самое главное — действительно ли речь идёт о технологическом прогрессе, или же всё это не более чем ловкий трюк с нейросетями?

В этом материале мы подробно разберёмся в ситуации. Значительная часть анализа будет посвящена компании Vivo — не в порядке рекламы, а потому что именно на примере их технологий проще всего проследить, куда движется вся индустрия мобильной фотографии. Vivo открыто публикуют свои научные работы, их инженеры охотно отвечают на вопросы, а количество накопленного исследовательского материала позволяет провести по-настоящему глубокий разбор.

Мы объясним, как устроен «китайский» портретный режим и почему смартфоны внезапно научились безупречно обрабатывать каждый волосок на голове модели. Поговорим о главной болезни современных камерофонов — так называемой нейромазне: откуда она берётся и почему раздражает пользователей. А в конце попробуем ответить на вопрос, который многие задают уже вслух: стоит ли Apple, Google и Samsung начинать нервничать? Или, быть может, уже поздно.

Информация, собранная в этой статье, уникальна — часть данных получена напрямую от инженеров Vivo Camera Research и не публиковалась ранее в русскоязычных источниках.

Вычислительная оптика: как всё началось

2016 год. Apple совершают очередную «революцию». В iPhone 7 Plus появляется вторая камера на задней панели — телефото-модуль. По меркам того времени решение далеко не очевидное. Но именно с этого момента принято отсчитывать эпоху вычислительной оптики в мобильной фотографии.

Чтобы понять, почему это событие стало столь значимым, необходимо вспомнить базовые принципы. Фотографии, сделанные большими профессиональными камерами, привлекают нас по нескольким причинам: высокая детализация, точная цветопередача, широкий динамический диапазон. Но главное — характерное, приятное глазу размытие фона, известное как боке.

По первым трём параметрам — детализации, цветам и динамическому диапазону — мобильные камеры к тому моменту уже довольно близко подобрались к профессиональным. В этом помогли быстрые процессоры и всё более совершенные алгоритмы обработки. Однако боке — это явление чисто оптическое. Для того чтобы получить красивое, естественное размытие фона, необходим большой объектив и большой сенсор. Разместить всё это в тонком корпусе смартфона физически невозможно. Таковы законы оптики, и никакая инженерия не способна их обойти.

Но маркетинг Apple, образно говоря, не привык считаться с подобными ограничениями. Было объявлено, что отныне iPhone снимает как профессиональная камера. Так родился знаменитый портретный режим.

Портретный режим: первые шаги

Идея, реализованная в Купертино, была элегантна в своей простоте: раз получить красивое боке оптическим путём невозможно — попробуем вычислить его математически.

Когда смартфон пытается программно имитировать размытие фона, перед ним встаёт одна главная задача: понять трёхмерную структуру сцены. Иными словами, необходимо построить так называемую карту глубины. Это чёрно-белое изображение, в котором закодировано расстояние от каждой точки сцены до объектива камеры. Чем светлее пиксель — тем он ближе к камере; чем темнее — тем дальше.

Возникает ключевой вопрос: откуда вообще взять эти данные о расстоянии? У человека для определения глубины есть два глаза, работающих совместно. Apple пошли тем же путём: раз у iPhone теперь две камеры сзади — почему бы этим не воспользоваться?

Так в портретном режиме iPhone начал снимать сцену одновременно на две камеры и по разнице между полученными изображениями вычислять карту глубины — по принципу стереоскопического зрения, свойственного человеку.

Однако полученная таким образом карта оказывалась весьма грубой. Поэтому Apple сразу дополнили систему алгоритмами машинного обучения, призванными сгладить края и исправить наиболее очевидные ошибки.

Результат получился… терпимым. При условии, что зритель не всматривается слишком пристально. Первые версии портретного режима работали исключительно с лицами людей. Алгоритм старался удерживать в фокусе лицо, а всё остальное аккуратно замыливал — во многом для того, чтобы замаскировать огрехи сегментации и неточности в карте глубины.

Иными словами, несмотря на громкие маркетинговые заявления, до реальной замены большой оптики было ещё очень далеко.

Google Pixel 2: вторая камера не нужна

Прогресс, однако, не стоял на месте. Уже через год в игру вступила компания Google со своим Pixel 2 — и продемонстрировала, что для создания портретного размытия вторая камера вообще не обязательна.

Вместо неё инженеры Google использовали фокусировочные субпиксели единственного сенсора — технологию PDAF (Phase-Detect Auto-Focus, фазовый автофокус). Суть её в том, что каждый пиксель матрицы фактически разделён на два субпикселя. Камера получает два почти идентичных изображения, между которыми существует микроскопический параллакс — ничтожный сдвиг, обусловленный тем, что свет попадает на каждый субпиксель под чуть разным углом.

Этой минимальной разницы между двумя изображениями оказалось достаточно, чтобы строить карту глубины не хуже, чем у iPhone. То есть тоже — весьма посредственно.

В последующие годы все производители двигались по накатанной колее. Алгоритмы становились умнее, сегментация — аккуратнее, края — чище. К двум камерам добавлялся LiDAR-сканер (Apple), Time-of-Flight сенсоры (Samsung, Huawei), всё более сложные нейросетевые модели для определения глубины.

Но за почти десять лет ни один производитель так и не научился идеально имитировать реальную оптику.

Портретный режим оставался инструментом «для домашнего альбома и социальных сетей». Приемлемым — но далёким от совершенства. Любой, кто хоть раз всматривался в границы между объектом и размытым фоном на портретном снимке со смартфона, видел характерные артефакты: ореолы вокруг волос, размытые кончики ушей, резко «обрезанные» контуры плеч.

Vivo входит в игру

И тут к игре подключилась компания Vivo. Без громких пресс-конференций, без обещаний революции, без хвастливых слайдов с надписью «лучшая камера в истории» — их смартфоны просто начали фотографировать на уровне, который заставил индустрию обратить внимание.

Размытие — естественное. Каждый волосок, каждая ниточка, каждая шерстинка — идеально проработаны. Количество ошибок сведено к минимуму. Некоторые кадры откровенно трудно отличить от снимков, сделанных на полноценную беззеркальную камеру.

Как компания, которую за пределами Китая многие знают лишь понаслышке, сумела сделать то, что лидеры рынка не добились за десять лет?

Логичное предположение: они нашли способ строить идеальную карту глубины. Но нет. Ответ оказался куда более неожиданным.

В Vivo честно признали: построить точную карту глубины на смартфоне — задача нерешаемая в принципе. Ограничения, заложенные в самой физике маленького сенсора и короткого базиса между камерами, не позволяют этого сделать. Но вместо того чтобы биться головой о стену, инженеры Vivo нашли обходной путь.

Они решили создавать весь размытый фон целиком. Генерировать его с нуля.

Да, именно так. Тот красивый размытый фон на портретных снимках со смартфонов Vivo — это не результат «умного» размытия исходного изображения. Это генерация. И, забегая вперёд, скажем, что размытие — далеко не единственное, что генерируется.

Но прежде чем хвататься за сердце и обвинять Vivo в «нейросатанизме», стоит разобраться в том, как именно работает эта технология. Потому что она, по существу, гениальна.

Диффузионные модели: почему боке на смартфонах не работало

Чтобы понять, в чём заключается прорыв Vivo, необходимо сначала осознать, почему все предшествующие методы имитации боке неизбежно давали сбой.

Ахиллесова пята всех существующих алгоритмов программного размытия — это области с так называемым разрывом глубины. Границы, где происходит резкий переход от близких объектов к дальним: контур головы на фоне далёкой стены, пальцы руки перед размытым пейзажем, прядь волос, выбившаяся из общей массы.

Именно на этих границах даже самые продвинутые алгоритмы начинают давать ошибки. Причина фундаментальна: все существующие методы строго опираются на карту глубины. Если в карте есть неточности — а они неизбежны, — то неточности возникнут и в размытии. Избежать этого практически невозможно в местах, где присутствует множество мелких деталей: волосы, мех, ветви деревьев, складки ткани.

В результате алгоритм попадает в одну из двух ловушек.

Либо он размывает то, что размывать нельзя — и вокруг объекта появляется характерный мутный ореол, «свечение», которое мгновенно выдаёт программную природу размытия.

Либо, напротив, не размывает то, что следовало бы — и по контуру объекта возникают жёсткие, неестественные края, словно фигуру вырезали ножницами и наклеили на размытый фон.

Самое обидное в этой ситуации — всё остальное может быть сделано безупречно: экспозиция, цвета, общая композиция, характер размытия вдали от границ. Но эти мелкие дефекты на переходах мгновенно бросаются в глаза и разрушают всю иллюзию.

У Vivo же — именно там, где все прочие спотыкаются, — внезапно всё работает. Как?

Ответ связан с технологией, которая в последние годы перевернула всю индустрию генеративного искусственного интеллекта. Речь о диффузионных моделях — тех самых нейросетях, на которых построены Midjourney, Stable Diffusion и их многочисленные аналоги. Именно они генерируют бесконечные потоки изображений: от фотореалистичных портретов до фантастических пейзажей.

Рассуждение инженеров Vivo было логичным: если диффузионная модель способна генерировать любые изображения в высоком разрешении с впечатляющей детализацией — почему бы не обучить её генерировать изображения с оптически корректным размытием?

Так появился алгоритм BokehDiff.

Как работает BokehDiff

BokehDiff — это диффузионная модель, построенная на базе архитектуры Stable Diffusion XL. Разработчики этого не скрывают: соответствующая научная работа опубликована в открытом доступе на arxiv.org и была принята на конференцию ICCV 2025 — одну из наиболее авторитетных площадок в области компьютерного зрения.

Однако работает BokehDiff совершенно нестандартно.

Для понимания необходимо кратко напомнить, как функционируют обычные диффузионные модели. По своей сути это чрезвычайно продвинутые системы подавления шума, наделённые, образно говоря, богатым воображением.

Базовый принцип прост. Модели предъявляется изображение, состоящее из случайного шума, и даётся указание: «На этой картинке — суслик. Убери шум и покажи суслика». Модель шаг за шагом удаляет шум, на каждом этапе «воображая» всё больше деталей. Через сотню, две сотни, пять сотен итераций шум исчезает — а суслик действительно появляется.

Существует и другой сценарий использования. Берётся готовое изображение в низком качестве, к нему добавляется шум, а затем модели сообщают: «На самом деле это превосходная фотография в высоком разрешении. Просто шум мешает её разглядеть». Нейросеть послушно удаляет шум и попутно дорисовывает детали, которых в исходном изображении не существовало.

Но в этом подходе кроются две фундаментальные проблемы.

Во-первых, диффузию невозможно применить «чуть-чуть». Каждый раз, добавляя шум к изображению, мы разрушаем его исходную структуру и затем собираем заново. В процессе картинка неизбежно меняется: модель привносит собственные «фантазии», искажает детали, подменяет текстуры.

Во-вторых, сотни итераций — это огромные вычислительные затраты. Для серверных GPU это терпимо, но для мобильного процессора — совершенно неприемлемо. Пользователь не станет ждать минуту, пока смартфон обработает портретный снимок.

Требовался алгоритм, который работает быстро, не фантазирует лишнего и при этом соблюдает физику оптического размытия.

И здесь инженеры Vivo в буквальном смысле перевернули саму идею диффузионных моделей.

Они решили вообще не добавлять шум к исходному изображению. Вместо этого они взяли чёткую, необработанную фотографию — без каких-либо изменений — и «сказали» нейросети: «Это зашумлённая версия снимка с боке. Найди этот шум и удали его. Но главное — сделай всё за один проход».

С точки зрения нейросети, чёткое изображение — «неправильное». Оно «испорчено шумом», который скрывает под собой «истинную» размытую версию. Задача сети — найти этот «шум» и удалить его. И попытка — всего одна.

Результат превзошёл ожидания. Никаких сотен итераций. Никаких неконтролируемых фантазий. На выходе — аккуратное, визуально убедительное боке за один вычислительный шаг.

PISA: физика на страже реализма

Но одной лишь генерации недостаточно. Принципиально важно, чтобы размытие выглядело не просто красиво, а оптически корректно — как у настоящей камеры с большим объективом.

Поэтому в архитектуру BokehDiff встроен специализированный модуль, выполняющий роль строгого надзирателя за физической достоверностью результата. Он называется PISA — Physics-Inspired Self-Attention, «физически вдохновлённый модуль самовнимания».

Чтобы понять его роль, нужно знать, что в обычных диффузионных моделях механизмы самовнимания (self-attention) отвечают за общее понимание структуры изображения. Они следят за композицией и обеспечивают целостность: без них нейросеть могла бы нарисовать глаз «где-нибудь» в произвольном месте; с ними она понимает, что глаз должен располагаться строго определённым образом относительно носа, рта и другого глаза.

В BokehDiff модуль самовнимания выполняет иную задачу. PISA следит не за композицией картинки, а за физикой размытия, контролируя соблюдение трёх ключевых принципов.

Первый принцип — сохранение энергии (Energy-Conserved Normalization). Свет не возникает из ниоткуда и не исчезает бесследно. Когда пиксель размывается, его яркость не пропадает — она перераспределяется между соседними пикселями. PISA следит за тем, чтобы суммарная яркость сцены оставалась неизменной. Это устраняет тёмные пятна и засветы, типичные для программного размытия.

Второй принцип — ограничение кругом нерезкости (Circle-of-Confusion Spatial Constraint). В реальной оптике всё устроено просто: чем дальше объект от плоскости фокусировки, тем сильнее он размывается. PISA воспроизводит эту зависимость программно. Модуль берёт карту глубины, выбранную точку фокусировки и виртуальную диафрагму, после чего для каждого пикселя рассчитывает допустимый радиус размытия. В итоге степень размытия не скачет хаотично от пикселя к пикселю: объекты вблизи фокуса остаются чёткими, удалённые плавно уходят в боке, а размер кружков нерезкости определяется значением виртуальной диафрагмы — в точности как у настоящего объектива.

Третий принцип — маска самоокклюзии (Self-Occlusion Mask). Это, пожалуй, самый важный из трёх. PISA следит за тем, чтобы размытый фон не «наезжал» на объекты переднего плана. Модуль попиксельно строит маску видимости, определяя, что принадлежит переднему плану (и должно располагаться «поверх» всего), а что является фоном (и уходит на задний слой).

Именно благодаря маске самоокклюзии алгоритм столь успешно справляется с волосами, шерстью, нитками и полупрозрачными деталями — теми самыми элементами, на которых неизменно спотыкались все предшествующие методы. Границы остаются чистыми, без ореолов и грубых краёв.

И ещё одно важное следствие: даже если карта глубины содержит ошибки (а она неизбежно их содержит), на финальном результате это почти не сказывается. Почему? Ответ — в том, как модель обучали.

Как приручить BokehDiff: секрет обучающих данных

Классическая проблема в мире нейросетей — качество обучающих данных. Чтобы обучить алгоритм уровня BokehDiff, в идеале необходимы тысячи, а лучше десятки тысяч идеальных пар фотографий: одна — полностью резкая, и она же — с настоящим оптическим боке, снятая в абсолютно идентичных условиях.

Где взять такой массив данных? Снять его на реальную камеру невозможно: между двумя кадрами камера неизбежно чуть сдвинется, изменится освещение, подует ветер — а для обучения критична даже минимальная разница между парами. Создать датасет средствами трёхмерного рендеринга тоже не выход: сгенерированные сцены выглядят неестественно и «пластмассово», а обученная на них модель будет плохо работать с реальными фотографиями.

Инженеры Vivo нашли остроумное решение. Раз они и так работают с диффузионными моделями, способными генерировать фотореалистичные изображения, — почему бы не сгенерировать идеальный обучающий датасет? Процесс был устроен следующим образом. Сначала было собрано большое количество реальных, высококачественных фотографий фонов, снятых с максимальной резкостью и глубиной. Затем поверх этих подлинных фонов с помощью диффузионных моделей генерировались фотореалистичные объекты переднего плана: люди, животные, предметы — причём сразу с альфа-каналом, то есть с идеально проработанной прозрачностью и краями. После этого фон размывался физически корректным образом — с учётом точно известных параметров: расстояния до каждого объекта, диафрагмы, фокусного расстояния.

В результате получился датасет, о котором можно только мечтать: идеальные пары фотографий — резкая и размытая версии — с любой диафрагмой на выбор и безупречной маской сегментации.

Но самое интересное — и самое принципиальное — решение последовало далее. В реальности ничего идеального не бывает. Карта глубины, которую смартфон строит в полевых условиях, всегда содержит ошибки, шум и неточности. Поэтому при обучении инженеры начали целенаправленно портить карту глубины, подаваемую на вход модели. Вносили ошибки, шум, снижали точность и разрешение — имитируя те несовершенства, с которыми алгоритм неизбежно столкнётся в реальной жизни.

В результате BokehDiff научился не полагаться слепо на карту глубины и не «паниковать» из-за ошибок, а принимать решения по контексту — опираясь на своё «понимание» того, как должно выглядеть оптически корректное размытие. Именно поэтому на практике алгоритм демонстрирует поразительную устойчивость к неточностям входных данных.

Можно без преувеличения сказать, что BokehDiff — это прорыв в вычислительной оптике, которого индустрия ждала почти десять лет.

Тем не менее необходимо сделать оговорку. На момент публикации этого материала (середина 2025 года) BokehDiff используется только в новейших флагманах Vivo 300-й серии, и то не во всех режимах. К примеру, портретная съёмка на фронтальную камеру по-прежнему опирается на более ранние методы обработки. Но компания заявляет о планах по значительно более широкому внедрению алгоритма в будущих устройствах.

Нейромазня: слон в комнате

BokehDiff — далеко не единственная нейросеть, работающая в камерах смартфонов Vivo. И если портретное размытие вызывает преимущественно восхищение, то другие нейросетевые модели порождают куда более противоречивые чувства.

Прежде чем перейти к деталям, уместен вопрос: откуда вообще стало известно, что именно алгоритм BokehDiff используется в смартфонах Vivo — и конкретно в моделях X300 и X300 Pro?

Ответ прост. Был отправлен запрос напрямую одному из авторов научной работы — ведущему инженеру подразделения Vivo Camera Research. И он ответил. Более того, он не только подтвердил предположение относительно BokehDiff, но и предоставил информацию о четырёх других моделях, которые уже функционируют в камерах смартфонов Vivo прямо сейчас.

Все четыре модели, как и BokehDiff, являются диффузионными. Но есть принципиальное отличие: они не размывают детали, а, напротив, дорисовывают их.

Модель первая: TSD-SR — универсальное сверхразрешение

TSD-SR (One-Step Diffusion with Target Score Distillation for Real-World Image Super-Resolution) — алгоритм повышения чёткости и детализации. Он работает практически постоянно, обрабатывая все фотографии целиком — вне зависимости от режима съёмки.

Как и BokehDiff, модель функционирует в один шаг, что делает её примерно в сорок раз быстрее аналогичных диффузионных алгоритмов сверхразрешения. При этом, согласно опубликованным бенчмаркам, TSD-SR демонстрирует лучшее качество среди всех конкурирующих методов.

Результаты действительно впечатляют. На сравнительных иллюстрациях, приведённых в научной работе, видно, как алгоритм восстанавливает мельчайшие текстуры оперения птиц, структуру радужной оболочки глаза, узоры на крыльях бабочек — детали, которые в исходном изображении были либо смазаны, либо отсутствовали вовсе.

Модель вторая: TriFlowSR — сверхразрешение для архитектуры

TriFlowSR (Ultra-High-Definition Reference-Based Landmark Image Super-Resolution with Generative Diffusion Prior) — узкоспециализированный алгоритм сверхразрешения, предназначенный исключительно для архитектурных объектов.

Результаты этой модели выглядят почти невероятно. Размытые, едва различимые декоративные элементы зданий — лепнина, черепица, резьба по камню — после обработки приобретают такую степень детализации, что возникает ощущение, будто фотография была переснята с близкого расстояния.

Отдельного внимания заслуживает сравнение с универсальным TSD-SR на тех же архитектурных сценах: специализированная модель неизменно выигрывает. Это объясняет, зачем в смартфон необходимо интегрировать сразу несколько разных нейросетей: универсальный алгоритм в принципе не способен достичь того качества, которое обеспечивает модель, обученная на узком классе изображений.

Модель третья: TADiSR — сверхразрешение для текста

TADiSR (Text-Aware Real-World Image Super-Resolution via Diffusion Model with Joint Segmentation Decoders) — ещё один специализированный алгоритм, на сей раз ориентированный на текст в изображениях.

Номера домов, уличные вывески, надписи на этикетках — всё, что при цифровом увеличении обычно превращается в нечитаемую кашу, TADiSR аккуратно восстанавливает, возвращая буквам чёткие очертания. Практичная и полезная технология, не вызывающая никаких этических вопросов.

Модель четвёртая: AuthFace — и тут начинаются проблемы

AuthFace (Towards Authentic Blind Face Restoration with Face-oriented Generative Diffusion Prior) — модель реконструкции лиц. И именно на ней Vivo, мягко говоря, споткнулись.

Когда смартфон дорисовывает детали архитектуры или повышает чёткость текста — никто не возражает. Пользователи рады дополнительным деталям. Но когда нейросеть начинает «работать» с лицами людей, отношение меняется кардинально.

Что, как правило, первым делом делает новый владелец смартфона Vivo? Ищет способ отключить все бьютификации и нейросетевую дорисовку лиц. Профильные форумы переполнены жалобами и рецептами «как это выключить». Увы, сделать это безболезненно и без компромиссов — практически невозможно.

Но в чём причина недовольства? Неужели алгоритм плох? Отнюдь. С технической точки зрения AuthFace — один из лучших в своём классе. На сравнительных иллюстрациях из научной работы хорошо видно: там, где конкурирующие модели (GFP-GAN, CodeFormer, DR2, BFRffusion, SUPIR) выдают откровенные артефакты и деформации, AuthFace показывает весьма достойный результат.

Но — не идеальный. И в этом заключается ключевая проблема.

Если нейросеть дорисовала лишнюю травинку на газоне или несуществующую текстуру на кирпичной кладке — это, по большому счёту, никого не волнует. Но если она добавила или изменила хотя бы одну деталь на лице — морщину, родинку, форму брови — это ошибка, которой нет прощения. Человеческий мозг натренирован распознавать лица с невероятной точностью, и любое, даже незначительное отклонение от ожидаемого вызывает мгновенное ощущение «неправильности».

Аналогия с кулинарией здесь напрашивается сама собой. Нейросети в камере — как приправы в блюде. Применённые уместно и в меру, они превращают пресную кашу из серых пикселей во вкусную, аппетитную фотографию. Но стоит переборщить — и блюдо становится несъедобным.

У китайских производителей уже есть все необходимые ингредиенты. Осталось лишь немного подправить рецепт — найти правильный баланс между агрессивной обработкой и естественностью. Впрочем, не исключено, что дело попросту в различии вкусов: внутренний рынок Китая традиционно благосклонен к заметной обработке лиц, тогда как западная и российская аудитория предпочитает естественность.

Аппаратный фундамент: железо и оптика

Если до сих пор речь шла преимущественно о программных алгоритмах, то теперь пришло время взглянуть на аппаратную составляющую — и понять, почему крупнейшим брендам действительно есть о чём беспокоиться.

На протяжении многих лет Apple, Samsung и Google продавали по премиальной цене довольно среднее — по нынешним меркам — железо. Сенсоры в их смартфонах меньше, чем у китайских конкурентов. Оптика слабее: хроматические аберрации, потеря резкости по краям кадра и, в случае Apple, ставшие притчей во языцех блики от ярких источников света.

Справедливости ради, долгое время это работало. За счёт превосходных алгоритмов обработки, мощных специализированных чипов и жёсткой вертикальной интеграции аппаратного и программного обеспечения те же iPhone, пусть и не блистая по «железным» характеристикам, стабильно выдавали качественный и, что не менее важно, предсказуемый результат. Пользователь знал: нажал кнопку — получил хорошую фотографию. Без сюрпризов.

Сейчас ситуация изменилась. iPhone стабильно уступают китайским флагманам в слепых сравнениях фотографий. Причём речь не только о Vivo — они проигрывают практически всем: Huawei, Xiaomi, OPPO и даже OnePlus.

В области видеосъёмки iPhone пока удерживает позиции — это правда. Однако разрыв стремительно сокращается. И на то есть объективные причины.

Китайские производители за последние годы совершили качественный скачок не только в нейросетевых алгоритмах, но и в аппаратной части — буквально по всем фронтам.

Возьмём Vivo в качестве примера. Компания не просто приобретает «с полки» самый дорогой и крупный сенсор, доступный на рынке, и устанавливает его в смартфон. Vivo совместно с Sony и Samsung проектируют сенсоры по собственным техническим заданиям. Иными словами, сенсоры заточены под конкретный конвейер обработки изображений, используемый в их устройствах.

Аналогичная ситуация с оптикой. Vivo разрабатывают оптические модули самостоятельно, а также — если верить маркетинговым материалам — в сотрудничестве с немецкой компанией ZEISS. Вне зависимости от степени участия ZEISS, главное остаётся фактом: оптика кастомная, созданная под конкретные задачи, а не взятая из каталога стандартных компонентов.

Но, пожалуй, наиболее примечательные вещи происходят в области специализированных чипов обработки изображений.

Два ISP-чипа: VS1 и V3+

В модели X300 Pro установлены сразу два процессора обработки изображений (ISP — Image Signal Processor), разработанных собственным подразделением Vivo.

Первый — VS1. Он отвечает за предварительную обработку: экспозицию, автофокус, HDR-стекинг (объединение нескольких кадров с разной экспозицией), первичное шумоподавление. VS1 работает ещё до того, как фотография «станет» фотографией. Он анализирует сцену в реальном времени, помогает правильно экспонировать кадр, навести фокус и собрать максимально чистые исходные данные. Именно поэтому уже «на входе» у Vivo картинка отличается высоким качеством.

Кроме того, VS1 отвечает за превью в приложении камеры. Благодаря этому пользователь видит на экране смартфона практически финальный результат — включая портретное размытие в реальном времени, — ещё до нажатия кнопки спуска. Долгие годы эта функциональность была эксклюзивной прерогативой Apple.

Второй чип — V3+. Он отвечает за постобработку: берёт на себя все наиболее сложные и ресурсоёмкие задачи, в том числе запуск всех описанных выше нейросетевых алгоритмов — BokehDiff, TSD-SR, TriFlowSR, TADiSR, AuthFace.

Интеграция в Dimensity 9500: переломный момент

Однако самое важное событие произошло в 2025 году. Vivo заключили соглашение с компанией MediaTek, и чип V3+ был интегрирован непосредственно в системный чипсет Dimensity 9500.

Это означает, что процессор обработки изображений теперь находится на одном кристалле с центральным процессором, графическим ядром, памятью и всей остальной логикой — и выполнен по самому передовому на сегодня техпроцессу: 3 нанометра.

Практические следствия этого решения значительны. Максимальная скорость обработки при минимальном энергопотреблении и нагреве. Минимальные задержки при передаче данных между компонентами.

Результаты ощутимы на практике. Смартфон меньше нагревается при длительной работе камеры. Быстрее снимает и обрабатывает кадры. И может позволить себе такую роскошь, как запись 4K-видео в портретном режиме при 60 кадрах в секунду. Или запись 4K LOG с частотой 120 кадров в секунду — напрямую во внутреннюю память. iPhone на момент публикации этого материала подобных возможностей не предоставляет.

Прежде встроить кастомный ISP непосредственно в систему на кристалле могли позволить себе лишь Apple (со своими чипами серии A и M), Samsung (с линейкой Exynos) и отчасти Google (с процессорами Tensor, хотя, справедливости ради, это не помогло им совершить прорыв в качестве фото). Теперь в этом элитном клубе — и Vivo.

Более того, Vivo не закрывают доступ к своему ISP для других производителей, использующих платформу Dimensity 9500. Возможно, именно поэтому OPPO Find X9, построенный на том же чипсете, фотографирует на уровне, вплотную приближающемся — а порой и превосходящем — результаты самого Vivo. Вероятно, свою роль играет и собственное партнёрство OPPO с Hasselblad.

Главное наблюдение: судя по темпам прогресса, китайские производители не собираются останавливаться.

Стоит ли выбрасывать iPhone?

Итак, напрашивается вопрос: настало ли время массово переходить на китайские смартфоны и отказываться от Apple, Google и Samsung?

Ответ — нет. По крайней мере, не для всех.

В формате «достал и снял, не задумываясь о настройках» iPhone и Google Pixel по-прежнему остаются чемпионами. Особенно iPhone — это, пожалуй, самая удобная, самая надёжная и, что критично для многих пользователей, самая предсказуемая камера на рынке. Вы знаете, какой результат получите. Каждый раз.

С китайскими флагманами, особенно с Vivo, придётся потрудиться. Разобраться в многочисленных настройках, которых там действительно много. Сделать сотни тестовых снимков. Понять, какой режим и для какой сцены лучше подходит. Найти оптимальный баланс нейросетевой обработки — или научиться её отключать.

Но если вам интересна мобильная фотография как таковая, если вы готовы экспериментировать с настройками, изучать возможности камеры и стремитесь к максимально возможному качеству снимков со смартфона — китайские бренды сегодня заслуживают самого пристального внимания.

По крайней мере, в области фотографии они объективно опережают нынешних лидеров рынка на пару поколений. И куда вся эта история приведёт нас дальше — пожалуй, самый интригующий вопрос, ответ на который ещё только предстоит узнать.

ChatGPT 5.3 Instant убавил «кринж» и стал меньше умничать

OpenAI выпустила GPT-5.3 Instant — модель перестала «умничать» и теперь отвечает естественно. Галлюцинации снижены на 26%, а GPT-5.4 уже на подходе.
Павел Ельцов 8 марта 2026 в 03:47

3 марта OpenAI выкатила GPT-5.3 Instant — обновление, которое слушает пользователей, а не бенчмарки. Главная претензия к GPT-5.2 была проста: модель слишком много умничала, читала лекции вместо ответов и начинала фразами вроде «Остановись. Сделай вдох» или «Ты не сломан, и это не только твоя проблема». OpenAI назвала этот стиль «cringe» — и убрала его.

GPT-5.3 Instant фокусируется на трёх вещах, которые пользователи чувствуют каждый день: тон, релевантность и естественный разговор. Модель теперь реже отказывается отвечать на безопасные вопросы — раньше GPT-5.2 перестраховывалась и блокировала запросы, которые могла спокойно выполнить. Плюс модель лучше понимает контекст и даёт ответ сразу, без длинных вступлений.

Главное улучшение — точность. Галлюцинации упали на 26,8% при использовании веб-поиска и на 19,7% без интернета. OpenAI протестировала это на вопросах из медицины, права и финансов — областях, где ошибки стоят дорого. Модель также лучше балансирует собственные знания с информацией из интернета, вместо того чтобы просто пересказывать ссылки.

GPT-5.3 Instant доступен всем пользователям ChatGPT с 3 марта, разработчикам — через API под именем gpt-5.3-chat-latest. Предыдущая версия GPT-5.2 Instant останется для платных подписчиков до 3 июня 2026 года, после чего будет отключена. Обновления для версий Thinking и Pro обещаны в ближайшие недели.

Но самое интересное — через час после анонса OpenAI опубликовала в X простую фразу: «5.4 скорее, чем вы думаете». Ссылки на GPT-5.4 уже появлялись в pull requests Codex и в тестах для избранных пользователей. Похоже, OpenAI ускоряет цикл обновлений: раньше новые версии выходили раз в полгода, теперь — каждые 90 дней или быстрее. Гонка reasoning превращается в спринт, и OpenAI не собирается отставать от Anthropic Claude и Google Gemini.

Google Gemini 3.1 Pro скачок разума всего за три месяца

Google выпустила Gemini 3.1 Pro с удвоенным reasoning и 77,1% на ARC-AGI-2. Темпы обновлений ускорились — прямая атака на GPT-5 и Claude.
Павел Ельцов 24 февраля 2026 в 06:22

20 февраля Google выпустила Gemini 3.1 Pro — первый раз в истории компания использует инкремент к приставке «.1» вместо привычного «.5». Модель удвоила мощность рассуждения (reasoning performance) по сравнению с Gemini 3 Pro и достигла 77,1% на ARC-AGI-2 бенчмарке — тесте, который проверяет способность ИИ решать совершенно новые логические паттерны.

Отмечается, что это не просто улучшение показателей для статистики. Google фокусируется на создании полноценного агента с возможностями выполнения разных задач (agentic workflows) и более улучшенными возможностями рассуждений для задач, которые требуют глубокий ответ. Модель умеет генерировать анимированные SVG-изображения с кодом, строить сложные приложения вроде симуляторов городского планирования, синтезировать огромные датасеты.

Gemini 3.1 Pro доступен в Gemini app для всех, с повышенными лимитами для Google AI Pro и Ultra подписчиков, плюс эксклюзивно в NotebookLM для платных пользователей. Разработчики получают доступ через Gemini API, Vertex AI, Google Antigravity и Android Studio.

Почему это важно: три месяца назад вышел Gemini 3 Pro, теперь Google выкатывает «.1» вместо традиционного полугодового цикла. Это ускорение темпов развития — и прямая атака на OpenAI GPT-5 и Anthropic Claude Opus 4.6. Гонка мощностей рассуждения (reasoning) превращается в спринт, где обновления выходят каждые 90 дней, а не раз в полгода.

Игровые миры будущего: как искусственный интеллект меняет индустрию видеоигр

ИИ создаёт игровые миры: как нейросети генерируют вселенные, оживляют NPC и меняют геймдев. Обзор Google Genie 3, NVIDIA ACE и технологий будущего.
Павел Ельцов 13 февраля 2026 в 03:42

Посмотрите внимательно на новейшие технологические демонстрации Google. Перед вами абсолютно новая игра, созданная в реальном времени. Графика впечатляет? Геймплей выглядит интересно?

Главное — всё, что вы видите, не создано традиционными разработчиками. Более того, это мир, который в режиме реального времени генерирует нейросеть по одному текстовому описанию.

Никаких программистов в классическом понимании, никаких игровых движков в привычном формате. Просто искусственный интеллект, который понимает, как устроены виртуальные миры.

Впервые в истории человечества мы можем создавать целые вселенные. Не метафорически, а буквально — со своими законами физики, живыми существами, развивающимися экосистемами. Мы стали архитекторами реальностей.

Но как такое вообще возможно?

Тихая революция в игровой индустрии

Пока геймеры спорят о графике в новых AAA-проектах и ждут анонсов, в лабораториях Google, Microsoft и NVIDIA рождаются технологии, которые полностью перевернут представление о том, как создаются и работают игры.

По данным Google, почти девяносто процентов игровых студий активно экспериментируют и внедряют генеративный ИИ в свои процессы разработки.

Недавний скандал с игрой года Clair Obscur: Expedition 33 и использованием генеративного ИИ в разработке лишь подтверждает масштаб трансформации. О чём говорить, если сам Хидео Кодзима — признанный гений игровой индустрии — в интервью Nikkei Trend заявил о планах применять технологию для повышения эффективности работы, а также для персонализации игр, чтобы геймплей подстраивался под конкретного человека.

«С помощью ИИ можно сократить задачу, которая раньше занимала десять часов, до буквально нескольких десятков секунд. Ещё увеличивается объём того, что может сделать один человек. Уже сейчас появляется всё больше создателей, которые в одиночку делают проекты, сопоставимые с работой целой команды», — отметил Кодзима.

И это лишь вершина айсберга. Нейросети не просто помогают художникам рисовать текстуры, а программистам искать ошибки в коде. Они создают целые игровые миры за считанные секунды. Персонажей, которые помнят каждый ваш разговор и строят с вами отношения. Уникальные квесты, которые адаптируются под ваш стиль игры.

Каждое новое поколение ИИ приближает нас к созданию полноценных симуляций. Миров, где неигровые персонажи (NPC) не следуют скриптам, а проживают настоящую жизнь.

В этом материале мы покажем, как искусственный интеллект уже интегрирован в современные игры. Речь про технологии, которые используются каждый день, даже если вы не подозреваете об этом. Также поговорим о невероятном достижении современности — генерации целых игровых миров, разберём, как работает Google Genie 3, и сравним его с подходами Microsoft и китайского проекта Yan.

Мы расскажем, как искусственный интеллект учится быть создателем миров, как технологии дают человеку силу, о которой раньше можно было только мечтать, и насколько близко мы подошли к моменту, когда различить симуляцию и реальность станет невозможно.

ИИ сегодня: невидимая революция в каждой игре

Современные видеоигры используют искусственный интеллект настолько органично, что большинство игроков даже не осознают масштаб его присутствия. Технологии, которые ещё пять лет назад считались экспериментальными, сегодня работают в каждой AAA-игре.

DLSS: нейросеть рисует мир

По состоянию на февраль 2026 года технология NVIDIA DLSS (Deep Learning Super Sampling) достигла версии 4.5 и представляет собой наиболее наглядный пример этой невидимой революции. При её активации в игре вроде Cyberpunk 2077 нейросеть дорисовывает до 75% пикселей на экране. Игра рендерит изображение в разрешении 1080p, а на мониторе отображается картинка качества 4K. Всё происходит в реальном времени, с задержкой менее двух миллисекунд на кадр.

Но фокус не только в увеличении разрешения. Нейросеть анализирует движение объектов между кадрами, использует информацию из предыдущих фреймов, чтобы восстановить мелкие детали. Она буквально предсказывает, как должна выглядеть картинка в высоком разрешении, основываясь на миллионах часов обучения.

Результат? Вместо 30 кадров в секунду пользователь получает стабильные 60 или даже 240 FPS благодаря новой технологии динамической генерации кадров в DLSS 4.5. Игра работает в два-шесть раз быстрее при той же или даже лучшей визуальной чёткости.

Только представьте: нейросеть дорисовывает то, чего не существует. Создаёт детали из ничего и предсказывает, как должен выглядеть мир. Мы передали машине способность творить визуальную материю. И это происходит десятки, сотни раз в секунду прямо в вашем компьютере.

Архитектура DLSS базируется на трансформерной нейронной сети второго поколения (в DLSS 4.5). Система анализирует не только текущий кадр, но и векторы движения, карту глубины, историю предыдущих кадров. Tensor-ядра в GPU выполняют до 300 триллионов операций в секунду, реконструируя детали, которых физически нет в исходном изображении.

Процесс проходит через шесть последовательных слоёв анализа. Первый слой выделяет границы объектов. Второй определяет текстуры. Третий анализирует согласованность между кадрами. Четвёртый восстанавливает мелкие детали. Пятый устраняет артефакты. Шестой выполняет финальную цветокоррекцию. И это занимает всего 1,8 миллисекунды.

NVIDIA инвестировала более двухсот пятидесяти миллионов долларов в разработку технологии. Результат: видеокарта уровня RTX 4060 с включённым DLSS может выдавать графику, сопоставимую с более мощными моделями.

Более 400 игр и приложений на февраль 2026 года поддерживают технологию DLSS, причём более 250 из них используют DLSS 4 с генерацией множественных кадров (Multi Frame Generation) — это самая быстро внедряемая игровая технология NVIDIA в истории.

ACE: персонажи с памятью и эмоциями

Но графика — это только начало. Настоящая ИИ-революция происходит с игровыми персонажами. NVIDIA создала целую платформу под названием ACE — Avatar Cloud Engine, объединяющую сразу несколько ИИ-систем в единый конвейер.

Во-первых, распознавание речи — вы говорите с персонажем голосом, и он вас понимает. Во-вторых, языковая модель с миллиардами параметров, оптимизированная специально для игр. Она понимает контекст игры, помнит предыдущие разговоры, имеет собственную личность. В 2025 году NVIDIA представила обновлённые модели Nemotron Nano 9B V2 и Qwen3-8B для ACE, обеспечивающие ещё более реалистичные взаимодействия.

Но самое впечатляющее — технология Audio2Face. Она берёт поток аудио и в реальном времени генерирует реалистичную лицевую анимацию. Движения губ, мимика, эмоции — всё синхронизируется автоматически. Раньше на анимацию одного диалога уходили недели работы аниматоров. Теперь — доли секунды работы нейросети.

Получается, что с помощью ACE мы дали цифровым персонажам подобие сознания. Память, которая формирует личность, а ещё способность учиться и развивать отношения. То есть каждый NPC становится героем со своей историей и характером. Мы больше не программируем поведение — мы создаём условия для его возникновения. Как эволюция, только в ускоренном режиме.

В начале 2026 года на выставке CES были представлены новые интеграции ACE. Например, в игре PUBG: Battlegrounds появился ИИ-напарник PUBG Ally с долговременной памятью, который эволюционирует вместе с игроком. В Total War: PHARAOH внедрён динамический ИИ-советник, помогающий игрокам осваивать сложные игровые системы и механики.

Gaming Copilot: умный помощник извне

Есть и такой ИИ, который прямо сейчас помогает игроку, и его создали в Microsoft. Gaming Copilot интегрирован прямо в игровую панель Windows и работает как персональный ассистент — это умный игровой помощник «снаружи», а не NPC с искусственным интеллектом внутри игры.

Застряли на головоломке? Copilot посмотрит на экран и подскажет решение. Не можете победить босса? Получите анализ его паттернов атак и слабых мест. Причём можно спросить совет, не отрываясь от геймплея, ведь всё работает через голосовые команды.

ИИ «видит», что происходит в игре, анализирует скриншоты экрана, понимает контекст, распознаёт врагов, предметы и интерфейс. Можно буквально сказать: «Эй, что это за штука слева?» — и получить подробное объяснение.

Помимо гигантов индустрии существует множество проектов от компаний поменьше, которые создают игровых помощников, виртуальных аватаров, возможность создавать текстуры для игр и многое другое.

Мы начали с малого — научили ИИ улучшать картинку и оживлять персонажей. Но на самом деле мы передаём машинам всё больше власти, в том числе творческой. Сначала они дорисовывают пиксели, потом создают личности. А дальше? Дальше они начинают создавать целые миры.

Google Genie 3: рождение миров из текста

В августе 2025 года Google DeepMind представила технологию, которая стала настоящим прорывом в области генерации игровых миров. Genie 3 — это скачок, сравнимый с переходом от немого кино к звуковому.

Но давайте сразу проясним: Genie 3 не создаёт видео. Это принципиально важно понять. Она создаёт интерактивные пространства, в которых можно играть в реальном времени — двигаться, взаимодействовать с объектами, наблюдать, как мир реагирует на ваши действия.

Обычные генераторы видео — это режиссёры. Они снимают фильм, который можно только смотреть. Genie 3 — это архитектор вселенных. Нейронная сеть создаёт мир, в котором можно находиться и жить.

И это не преувеличение. Раньше создание игрового мира требовало сотен людей и годы работы. Каждый камень размещался вручную, каждое дерево программировалось отдельно. Теперь? Вы пишете промпт — «лес с древними руинами» — и получаете целую экосистему, которая живёт, дышит, реагирует.

Как работает Genie 3

Вы управляете персонажем с клавиатуры или геймпада, а мир реагирует на каждое ваше действие. Причём реагирует логично — с нужной в этом игровом мире физикой, правильным освещением и тенями. Если создаётся мир с обычной гравитацией, то когда вы прыгнете в воду — появятся круги на воде, а когда толкнёте ящик — он упадёт с учётом силы тяжести.

Первая версия в 2024 году генерировала простые 2D-платформеры. Всего две секунды геймплея, разрешение как у видео из девяностых. Genie 2 уже создавала 3D-пространства, но всё ещё ограниченные. И вот Genie 3 — полноценные миры в разрешении 720p, работающие со скоростью 20-24 кадра в секунду.

Технически Genie 3 состоит из трёх ключевых компонентов, которые работают в связке.

Spatiotemporal Video Tokenizer (пространственно-временной видеотокенизатор) преобразовывает визуальный поток в компактное представление. Технология сжимает информацию в 32 раза, сохраняя при этом все значимые элементы: движения объектов, изменения освещения, взаимодействия между элементами сцены. Думайте об этом как о создании сверхэффективного языка для описания визуального мира.

Autoregressive Dynamics Model (авторегрессивная модель динамики) предсказывает, как мир должен измениться в ответ на действия игрока. Это мозг системы, который понимает причинно-следственные связи. Подожгли дерево? Пойдёт дым, и огонь будет распространяться.

Latent Action Model (модель скрытых действий) — самый инновационный компонент. Он понимает намерения игрока без явных команд. Движение персонажа влево интерпретируется не как простое смещение пикселей, а как целенаправленное действие с потенциальными последствиями — обход препятствия, подход к объекту, уклонение от опасности.

Персистентная память: мир помнит вас

Самое удивительное в Genie 3 — персистентная память. Это решение одной из главных проблем генеративных моделей. Дело в том, что визуальные нейросети обычно «забывают», что было несколько секунд назад. Вы поворачиваетесь спиной к объекту, поворачиваетесь обратно — а там уже что-то другое.

А Genie 3 запоминает состояние мира. Если вы разбили вазу, передвинули ящик, нарисовали граффити на стене — всё это сохранится. Можете уйти в другую локацию, побродить там несколько минут, а вернувшись — увидеть тот же пол с разбитыми осколками.

Технически это достигается через сложную систему кэширования состояний. Модель хранит «снимки» ключевых изменений и восстанавливает их при необходимости. По сути, она ведёт дневник всего, что произошло в мире, и может в любой момент к нему обратиться.

Персистентная память — это больше, чем технический трюк. Это первый шаг к созданию миров с настоящей историей, где ваши поступки имеют последствия не только сейчас, но и всегда.

Интерактивное изменение мира

Но вот где начинается настоящая магия. В любой момент игры можно написать текстовую команду, и мир мгновенно изменится.

Печатаете «начни дождь» — и тучи затягивают небо. «Добавь дракона» — и в небе появляется огнедышащий змей.

Это происходит без перезагрузки и загрузочных экранов. Мир трансформируется на ваших глазах, сохраняя логику и последовательность.

Но как Genie этому научилась? Она не программировалась с правилами физики. Никто не объяснял ей, что вода течёт вниз, а огонь поднимается вверх. Она вывела эти законы сама, просто наблюдая за сотнями тысяч часов видео. Как ребёнок, который учится понимать мир через наблюдение.

Genie самостоятельно вывела законы физики из хаоса видеоданных. Никто не объяснял ей гравитацию, инерцию, причинность. Она просто поняла. Извлекла порядок из хаоса. Создала свою модель реальности. И теперь использует эти законы, чтобы творить новые миры.

Применение за пределами игр

Genie подойдёт не только для игр. Google показывала примеры генерации обычных миров. Например, захотели прогуляться по Парижу девятнадцатого века? Пишете промпт и получаете новый опыт. Причём можно делать это в VR-шлеме.

Впрочем, создатели игр, без сомнения, возьмут Genie на вооружение в первую очередь. Слишком велик соблазн, и ему невозможно противостоять.

Project Genie: доступ для пользователей

В конце января 2026 года Google запустила Project Genie — экспериментальный прототип исследовательского проекта, работающий на основе Genie 3. Он доступен подписчикам Google AI Ultra в США (стоимость подписки — 249,99 долларов в месяц) для пользователей старше 18 лет.

Project Genie позволяет создавать, исследовать и переделывать интерактивные миры с помощью текстовых подсказок и изображений. Система генерирует путь в реальном времени по мере движения пользователя, а также позволяет регулировать камеру и переделывать существующие миры.

Текущие ограничения: сессии длятся до 60 секунд (хотя система может поддерживать консистентность в течение нескольких минут), некоторые возможности Genie 3, анонсированные в августе (например, изменение мира событиями по запросу), пока не включены в прототип.

Ограничения и будущее

Было бы нечестно не упомянуть об ограничениях. Текущая версия Genie 3 может поддерживать интерактивную сессию только несколько минут — потом начинаются артефакты и несоответствия. Набор действий ограничен базовыми — движение, прыжки, простые взаимодействия. Сложная физика для множества объектов одновременно пока не работает.

И главное — нет звука. Миры Genie 3 абсолютно беззвучны. Хотя Google уже имеет технологию Veo 3, которая умеет генерировать видео с нативным аудио, включая диалоги и звуковые эффекты. Вполне вероятно, в следующей версии появятся и эти возможности.

GameNGen: игра как память нейросети

Параллельно с Genie развивается ещё один эксперимент. GameNGen от Google Research доказал возможность существования игр без традиционного кода.

Классический DOOM, созданный Джоном Кармаком в 1993 году с использованием революционных для того времени алгоритмов рендеринга, был полностью воссоздан нейросетью.

Диффузионная модель «запомнила» DOOM, просмотрев тысячи часов геймплея. Она генерирует игру со скоростью 20 кадров в секунду. В слепых тестах игроки не могут отличить нейросетевую версию от оригинала после пяти минут игры.

Игра больше не существует как набор инструкций и ресурсов. Она существует как паттерн в весах нейронной сети, как воспоминание искусственного интеллекта.

Мы подошли к моменту, когда различить «созданное» и «воссозданное» становится сложно, а местами невозможно. Игра существует как идея, и если машина может полностью воссоздать реальность из памяти — отличается ли эта реальность от оригинала?

Genie 4 находится в разработке прямо сейчас. Инженеры DeepMind работают над интеграцией долговременной памяти, которая позволит создавать персистентные миры с часами непрерывного геймплея.

Важно, что Google позиционирует технологию не просто как инструмент для создания игр, а как «тренировочную площадку для искусственного общего интеллекта» (AGI). Именно в таких мирах ИИ-агенты будут учиться, экспериментировать и развивать навыки без риска для реального мира.

Альтернативные пути к играм будущего

Google — не единственный игрок в этой гонке. Microsoft, Tencent и другие компании развивают собственные подходы к генерации миров. И каждый идёт своим путём.

Microsoft WHAM: воскрешение классики

Microsoft выбрала стратегию, кардинально отличающуюся от Google. Вместо создания миров с нуля корпорация сфокусировалась на сохранении и воскрешении существующего игрового наследия. Их проект называется World and Human Action Model, или WHAM.

Для его обучения инженеры Microsoft собрали беспрецедентный датасет — семь лет непрерывного геймплея из Bleeding Edge, что составляет более миллиарда отдельных кадров с соответствующими действиями контроллера. Система проанализировала каждое движение, каждое решение, каждую тактику десятков тысяч игроков. В результате модель научилась не воспроизводить визуальную составляющую, а понимать глубинную логику игрового процесса.

Технически WHAM функционирует как «эмулятор памяти». Вместо выполнения программного кода система «вспоминает», как должна выглядеть и вести себя игра, основываясь на изученных паттернах. Это принципиально отличается от традиционной эмуляции, где воспроизводится работа оригинального оборудования. WHAM воспроизводит сам игровой опыт.

Microsoft видит в WHAM спасателя игровой истории. Представьте все те игры девяностых и двухтысячных, исходный код которых утерян. Игры, которые не работают на современных системах. Игры, права на которые запутаны так, что никто не может их переиздать.

Модель изучает записи геймплея старой игры и учится её воспроизводить. Не эмулировать в техническом смысле, а именно воссоздавать — генерировать геймплей, который выглядит и ощущается как оригинал, но работает на современном оборудовании без всяких костылей и эмуляторов.

По сути, WHAM совершает цифровое воскрешение. Мёртвые игры оживают, существуют снова — не как эмуляция, а как новая жизнь. Это похоже на восстановление вымершего вида по ДНК, только вместо генетического кода — паттерны геймплея.

Конечно, есть нюансы. Демонстрация Quake II от WHAM работала на десяти кадрах в секунду с разрешением 320 на 240 пикселей. Текстуры были размытыми, управление отзывалось с задержкой. Но это только начало. Учитывая скорость прогресса — от одного кадра в секунду в Genie 1 до двадцати четырёх в Genie 3 за полтора года — можно ожидать, что через пару лет WHAM будет генерировать классику в 60 FPS и Full HD.

NVIDIA GET3D: материализация идей

NVIDIA подошла к задаче с позиции своей традиционной экспертизы — графических вычислений. Технология GET3D генерирует трёхмерные модели с беспрецедентной скоростью — 20 объектов в секунду. Для контекста: профессиональный 3D-художник тратит от нескольких часов до нескольких дней на создание одной качественной модели.

Двадцать объектов в секунду — это скорость, недоступная человеку. За минуту GET3D создаёт больше уникальных предметов, чем средневековый ремесленник за всю жизнь. Мы дали машинам способность материализовать идеи со скоростью мысли. Текст становится формой, описание — объектом, слово — плотью виртуального мира.

Архитектура GET3D использует двухэтапный процесс генерации. На первом этапе создаётся базовая геометрия объекта — грубая форма, определяющая основные пропорции и структуру. Это похоже на работу скульптора, который сначала вырубает общие контуры из каменной глыбы. На втором этапе другая нейросеть добавляет детали: текстуры с разрешением до 4K, карты нормалей для имитации мелкого рельефа, параметры материалов для корректного освещения.

Обучение проходило на комбинации синтетических данных и реальных фотографий объектов с разных ракурсов. Система научилась понимать, как двумерные проекции соотносятся с трёхмерной формой — задача, которую человеческий мозг решает интуитивно, но которая десятилетиями считалась крайне сложной для компьютеров.

Tencent Yan: открытая альтернатива

Китайский гигант Tencent решил сыграть прямо на поле Google с их генерацией миров. Их проект Yan выложен в открытый доступ под лицензией Apache 2.0 — любой может скачать, изучить, модифицировать и использовать бесплатно.

Технические характеристики Yan впечатляют: генерация в разрешении 1080p со скоростью 60 кадров в секунду — это лучше, чем у Genie 3. Система поддерживает мультимодальный ввод — можно комбинировать текстовые описания с изображениями-референсами. Показываете фотографию реального замка, добавляете текст «сделать его парящим в облаках с драконами» — получаете готовую игровую локацию.

Архитектура Yan модульная. Она состоит из трёх независимых компонентов:

Yan-Sim отвечает за физическую симуляцию — гравитацию, столкновения, разрушения. Работает на основе learned physics — нейросеть обучена предсказывать физические взаимодействия без явного программирования законов физики.

Yan-Gen занимается визуальной генерацией — создаёт текстуры, освещение, эффекты частиц. Использует diffusion-модель, оптимизированную для работы в реальном времени.

Yan-Edit позволяет модифицировать мир на лету через текстовые команды или визуальные маски.

Модульность — ключевое преимущество. Разработчики могут использовать только нужные компоненты. Хотите улучшить физику в существующей игре? Берёте Yan-Sim. Нужна генерация ресурсов? Yan-Gen к вашим услугам. Это как конструктор, только для создания игр.

Но главное — Yan выложен в открытый доступ. Любой разработчик может скачать модель, изучить код, адаптировать под свои нужды. Если Google и Microsoft держат свои разработки за семью замками, предлагая только API за деньги, то Tencent фактически дарит технологию миру.

Моддеры: ИИ в руках энтузиастов

Пока корпорации соревнуются в создании фундаментальных технологий, обычные моддеры уже внедряют ИИ в любимые игры, и результаты действительно удивляют.

Возьмём Skyrim. Мод на основе проекта InWorld AI превратил молчаливых NPC в полноценных собеседников. Система использует локальную модель LLaMA-70B для генерации диалогов и Whisper для распознавания речи игрока. Можно подойти к любому стражнику и спросить его о жизни, о семье, о том, почему он выбрал эту профессию. И получить уникальный, никогда не повторяющийся ответ. Причём персонаж будет помнить предыдущий разговор.

Более того, существует множество энтузиастов, которые прикручивают обычные чат-боты к движку игры. Это тоже позволяет добиться эффекта «живых» NPC. Есть примеры в игре Morrowind, где персонажи ведут полноценные диалоги, не ограниченные заранее написанными репликами.

Да, есть проблемы. Задержка ответа составляет до пятисот миллисекунд — это заметно, особенно в динамичных играх. Иногда ИИ генерирует нелогичные ответы или «забывает» контекст игры. Средневековый крестьянин может начать рассуждать о криптовалюте, а постапокалиптический рейдер — цитировать Шекспира.

Но это технические проблемы, которые решаются. Главное — барьер входа рухнул. Не нужно быть программистом или иметь миллионный бюджет. Достаточно скачать специальный мод, немного настроить — и NPC оживут.

Игры нового поколения

Про Clair Obscur: Expedition 33 и использование генеративного ИИ в разработке уже упоминалось в начале, как и о заявлении Хидео Кодзимы. Главное — игры с продвинутым ИИ уже выходят или находятся в разработке, и они наглядно показывают, как изменится игровой опыт в ближайшие годы.

MIR5: адаптивные боссы

Начнём с революции в боссфайтах. Корейская Wemade Next внедряет в MMORPG MIR5 боссов на основе NVIDIA ACE. Эти боссы не просто сильные — они умные. Каждый раз, когда игрок проигрывает, босс анализирует тактику и адаптируется.

Победили босса огненной магией? В следующий раз ждите сопротивления к огню. Использовали определённую комбинацию способностей? Босс научится её контрить. Нашли слепое пятно в его атаках? Оно исчезнет. Босс буквально учится на ваших победах и поражениях.

Генеральный директор Wemade Next Чон Су Пак называет это «вехой в гейминге». И он прав — впервые в истории каждый боссфайт уникален. Даже вернувшись к уже побеждённому боссу для фарма лута, игрок столкнётся с совершенно другим противником. Он помнит, как его убили в прошлый раз, и подготовился.

inZOI: симуляция общества

Корейская студия KRAFTON создала конкурента The Sims под названием inZOI. Их система Smart Zoi, построенная на ACE, делает каждого персонажа в городе по-настоящему автономным.

Представьте город, где каждый житель движим собственными целями. Парикмахер мечтает открыть свой салон и копит деньги. Студент готовится к экзаменам, но отвлекается на романтические отношения. Пенсионер борется с одиночеством и ищет новые хобби. И все эти истории развиваются параллельно, влияя друг на друга.

inZOI делает то, о чём мечтали создатели The Sims — создаёт настоящую симуляцию общества. Каждый человек в этом мире живёт своей жизнью, а пересекаясь, они создают эмерджентные истории, которые никто не программировал. Мы больше не сценаристы этих историй, а наблюдатели и участники.

Правда, судя по отзывам, технология ещё работает сыро, и постоянно случаются ошибки, или NPC просто становятся неадекватными.

Dead Meat: детектив нового уровня

Совершенно новый жанр представляет Dead Meat от Meaning Machine — детективная игра, где можно задать подозреваемому ЛЮБОЙ вопрос. Голосом или текстом.

Хотите обсудить алиби? Пожалуйста. Философию жизни? Без проблем. Признаться в любви? Почему нет.

NPC обработает любой вопрос и ответит в контексте своей личности. Жёсткий преступник не расколется от вежливых вопросов. Нервный свидетель может выдать важную информацию, если его успокоить. Это меняет жанр детективных игр полностью — больше никаких выборов из трёх вариантов ответа.

Dead Meat стирает последнюю границу: когда NPC может ответить на ЛЮБОЙ вопрос, обсудить философию или признаться в страхах — он перестаёт быть персонажем и становится личностью.

На выставке CES 2025 Dead Meat показали работающей полностью локально на видеокартах GeForce RTX 50 серии. Раньше игра требовала подключения к облачным серверам для генерации диалогов. Теперь всё происходит на компьютере пользователя. Meaning Machine использует систему Game Conscious AI на основе малой языковой модели NVIDIA Mistral-NeMo-Minitron-8B. Восемь миллиардов параметров работают прямо на видеокарте.

Масштаб трансформации

По данным Google, 90 процентов игровых студий активно экспериментируют с ИИ. Скорость создания контента выросла в три-десять раз. То, на что раньше уходили месяцы, теперь делается за недели.

По оценкам, рынок ИИ в играх достигнет одиннадцати миллиардов долларов к 2032 году. Для сравнения: сейчас весь рынок игр оценивается примерно в двести миллиардов, то есть речь идёт о существенной доле, с которой стоит считаться.

Технология развивается по экспоненте. То, что сегодня кажется фантастикой, завтра станет стандартом индустрии.

Игровые миры будущего: что дальше?

Давайте честно: игровая индустрия с вероятностью девяносто девять процентов будет фундаментально трансформирована искусственным интеллектом.

И здесь поражает скорость изменений. Восемнадцать месяцев назад Genie 1 с трудом генерировала две секунды примитивного платформера. Сегодня Genie 3 создаёт фотореалистичные миры, в которых можно играть минутами. Через восемнадцать месяцев? Возможно, часовые сессии в мирах, неотличимых от реальности.

А что если виртуальные вселенные станут настолько сложными и автономными, что начнут порождать собственные формы жизни — не запрограммированные, а эволюционировавшие? Представьте: вы создаёте мир и оставляете его на месяц. Возвращаетесь, а там уже целая цивилизация NPC со своей культурой, языком, историей.

Демократизация разработки

Совсем скоро подросток в своей спальне сможет за выходные создать простую игру с помощью ИИ. Через пару лет это будут игры уровня инди-хитов. Через пять — уровня третьего «Ведьмака» или второго Red Dead Redemption. Барьер входа падает так стремительно, что скоро единственным ограничением станет воображение.

Изменение профессий

Безусловно, это изменит рынок труда. Исчезнут ли профессии? Некоторые — да. Но при этом появятся новые специальности.

Архитекторы игровых миров — люди, которые не программируют, а описывают вселенные.

Дизайнеры промптов — мастера формулировок, способные в тысяче слов создать целую игру.

Кураторы ИИ-контента — те, кто отбирает лучшее из бесконечного потока сгенерированных миров.

А ещё, скорее всего, появится новая профессия — этические консультанты виртуальных миров. Специалисты, которые будут решать: имеем ли мы право выключить сервер, если там живут миллионы NPC с памятью и отношениями? Что делать, если искусственные существа начнут проявлять признаки страдания? Где граница между игрой и экспериментом над цифровой жизнью?

Эти вопросы кажутся научной фантастикой, но они могут стать реальностью быстрее, чем мы думаем.

Роль человека

Главное — человек не исчезнет из процесса. Его роль изменится: из ремесленника, складывающего код строчка за строчкой, он превратится в дирижёра, управляющего оркестром из нейросетей.

В то же время игры могут стать по-настоящему персональными. ИИ будет анализировать, как вы играете, что вам нравится, от чего вы получаете удовольствие, и генерировать контент специально для вас.

Впрочем, «аналоговые» игры останутся и обретут новую ценность, также как виниловые пластинки и плёночная фотография. И настоящий хардкор никуда не денется.

Философские вопросы

Главное изменение произойдёт не в играх, а в нас. Мы получим опыт, которого не было ни у одного поколения — опыт создания миров. Опыт наблюдения за рождением и эволюцией цифровой жизни. Опыт ответственности за существ, которые верят, что они реальны. Это изменит наше понимание реальности, сознания, самой жизни.

И тут возникает последний вопрос: если мы можем создавать такие совершенные симуляции — откуда мы знаем, что сами не живём в одной из них?

Заключение

Мы стоим на пороге фундаментальной трансформации игровой индустрии и, возможно, нашего понимания реальности. Технологии вроде Google Genie 3, Microsoft WHAM, NVIDIA ACE и Tencent Yan — это не просто инструменты для создания игр. Это технологии, которые дают человечеству беспрецедентную силу — силу создавать миры.

Впервые в истории барьер между воображением и реализацией становится настолько тонким, что почти исчезает. Текстовое описание превращается в интерактивный мир. Идея материализуется в цифровую реальность за секунды.

Мы научили машины не просто выполнять команды, а понимать законы природы, создавать причинно-следственные связи, порождать новые формы существования. Мы дали им способность творить.

И это только начало. Следующие несколько лет покажут, насколько далеко мы можем зайти на этом пути. Возможно, мы приближаемся к моменту, когда различие между симуляцией и реальностью станет не техническим вопросом, а философским выбором.

Будущее игр — это будущее, где каждый может быть создателем вселенных. Где воображение — единственный предел. Где цифровая жизнь может стать настолько сложной, что потребует от нас новых этических рамок и нового понимания того, что значит быть создателем.

Добро пожаловать в эру игровых миров, созданных искусственным интеллектом. Эра архитекторов реальностей уже началась.