
Ещё пару лет назад схема работы с нейросетью была предельно понятной.
Вы пишете:
Нарисуй кота в скафандре.
Телефон отправляет запрос куда-то в огромный дата-центр. Там работают GPU стоимостью как неплохая квартира, модель считает ответ, сервер отправляет результат обратно.
Сам смартфон в этой истории нужен примерно как почтальон.
Но сейчас всё больше ИИ начинает работать не в дата-центре, а непосредственно у вас в кармане.
Google запускает Gemini Nano прямо внутри Android. Apple открыла разработчикам свою системную языковую модель, работающую на устройстве. Qualcomm проектирует мобильные процессоры специально под локальный генеративный ИИ.
И возникает вполне разумный вопрос:
Зачем вообще мучить маленький телефон, если где-нибудь в дата-центре стоит железо в тысячу раз мощнее?
Потому что у облачного ИИ есть несколько проблем, которые невозможно решить простым увеличением количества видеокарт.
Вообще-то телефон давно набит нейросетями
Просто раньше мы их почти не замечали.
Вы фотографируете человека против солнца.
Телефон понимает, где лицо, где небо, где волосы, где фон, и обрабатывает разные части кадра по-разному.
Разговариваете в шумном помещении — алгоритмы отделяют голос от гула.
Разблокировка по лицу.
Распознавание речи.
Автокоррекция.
Сортировка фотографий.
Удаление шума.
Определение сцены камерой.
Мобильный ИИ существует много лет.
Новость последних лет в другом: на телефоне поселились генеративные модели, способные работать с обычным языком, изображениями и уже некоторыми мультимодальными задачами.
То есть вместо узкого алгоритма:
найди лицо на фотографии,
устройство получает модель, которой можно сказать:
прочитай это, пойми смысл и сделай вот так.
И это уже гораздо более универсальный инструмент.
Google сейчас держит Gemini Nano прямо внутри Android
Для этого у Android появился отдельный системный компонент — AICore.
Он управляет локальными моделями, обновляет их и предоставляет приложениям доступ к Gemini Nano. Google прямо указывает основные причины такой архитектуры: данные можно обрабатывать без отправки в облако, ИИ работает без интернета, уменьшается задержка и не возникает отдельной стоимости каждого запроса к серверу.
Причём это уже не лабораторная игрушка.
В июле 2026 года Google сообщила, что Gemini Nano работает более чем на 140 миллионах устройств. Новая Gemini Nano 4 оптимизирована специально под мобильное железо и используется для локальных задач вроде суммаризации, обработки документов, речи и изображений.
140 миллионов — уже достаточно, чтобы перестать говорить:
когда-нибудь телефоны смогут запускать ИИ.
Они запускают.
Вопрос теперь — что именно им имеет смысл делать самостоятельно.
Первый ответ очевиден: приватность
Допустим, я хочу попросить ИИ:
Вытащи из этого сообщения номер паспорта и заполни форму.
Для облачной модели схема примерно такая:
телефон → интернет → чужой сервер → обработка → интернет → телефон.
Даже если сервис идеально защищён и честно соблюдает правила конфиденциальности, данные физически покидают устройство.
Локальная модель позволяет сделать иначе:
телефон → процессор телефона → результат.
Номер паспорта никуда не отправлялся.
Google подчёркивает именно это свойство AICore: локальный запрос обрабатывается на устройстве, а сам системный компонент изолирован и не имеет прямого доступа в интернет.
Apple строит похожую философию. Её системная Foundation Model тоже может работать непосредственно на устройстве, а в новой инфраструктуре Core AI разработчик может запускать собственные модели полностью локально — без серверной зависимости и без передачи пользовательских данных наружу.
Для некоторых задач это не приятный бонус.
Это главная причина вообще использовать локальный ИИ.
Представьте персонального помощника, который действительно знает всё о вас
Сегодня мы хотим от AI-ассистента странного сочетания качеств.
С одной стороны:
Будь очень персональным.
Знай мои письма.
Календарь.
Фотографии.
Сообщения.
Документы.
Привычки.
Местоположение.
Контакты.
С другой:
И желательно никому всё это не отправляй.
😁
Облачной системе трудно выполнить оба требования одновременно.
Чем больше она знает о человеке, тем больше персональных данных приходится передавать на сервер.
Локальная модель меняет ситуацию.
Она потенциально может анализировать телефон изнутри.
Например:
найди сообщение, где мне присылали адрес ресторана;
напомни, когда я последний раз встречался с Иваном;
собери мои расходы по фотографиям чеков;
найди документ про страховку;
перескажи сегодняшние уведомления.
Если модель способна решить задачу локально, весь личный контекст необязательно отправлять в дата-центр.
И вот здесь смартфон превращается не просто в устройство с AI-функциями.
Он становится личной вычислительной зоной для ИИ.
Второе преимущество ещё банальнее: интернет иногда заканчивается
Самый умный облачный ассистент становится довольно бесполезным, когда телефон показывает:
E
или вообще ничего.
Самолёт.
Метро.
Горы.
Подвал.
Плохая связь.
Роуминг.
Перегруженная сеть.
Локальной модели всё равно.
Google прямо приводит offline inference как одно из основных преимуществ Gemini Nano. Apple для своей системной модели тоже отдельно указывает работу без сетевого соединения.
И здесь появляются очень практичные сценарии.
Перевести фразу за границей.
Расшифровать голосовую заметку.
Сделать краткое содержание документа.
Разобрать фотографию.
Исправить текст.
Получить подсказку.
Не надо ждать, когда мобильный интернет соизволит вспомнить о существовании цивилизации.
Третья причина — скорость
До облачной модели надо ещё добраться.
Телефон подготовил запрос.
Зашифровал.
Отправил.
Данные дошли до дата-центра.
Встали в очередь.
Модель обработала запрос.
Ответ отправился обратно.
В хорошем соединении это занимает немного времени.
Но для интерфейса даже несколько сотен лишних миллисекунд иногда очень заметны.
Особенно если ИИ используется не так:
написал запрос — жду ответ,
а постоянно работает внутри приложения.
Например, камера в реальном времени понимает сцену.
Телефон переводит речь во время разговора.
Ассистент реагирует на происходящее на экране.
Модель анализирует поток звука.
Здесь каждое путешествие в облако начинает мешать.
Локальная модель находится буквально рядом с данными.
Google в одном из свежих примеров оптимизации Gemini Nano сократила время генерации ответа с примерно 13 секунд до менее чем двух, причём вся обработка выполнялась непосредственно на устройстве.
Для человека разница между:
подожди 13 секунд
и
вот результат
огромная.
Но есть ещё причина, которая особенно нравится разработчикам: деньги
Каждый запрос к облачной нейросети кто-то оплачивает.
GPU потребляет электричество.
Серверы стоят денег.
Дата-центр надо построить.
Охладить.
Обслуживать.
Если приложение используют тысяча человек — терпимо.
Если сто миллионов пользователей каждый день десять раз вызывают AI-функцию, внезапно получается миллиард запросов в сутки.
И бухгалтер начинает интересоваться искусственным интеллектом гораздо сильнее.
😁
Google прямо называет отсутствие дополнительной стоимости каждого inference одним из преимуществ локальной обработки. Apple формулирует ещё жёстче: для локальных моделей нет серверной зависимости и нет стоимости токенов. (Android Developers Blog)
Модель уже лежит в телефоне.
Процессор уже купил пользователь.
Электричество тоже оплачивает пользователь.
Для массовых простых AI-функций экономическая разница огромная.
Поэтому производители процессоров срочно строят для нейросетей отдельные мозги
В старом компьютере было достаточно:
CPU — универсальный процессор.
Потом графика потребовала:
GPU.
Теперь всё чаще появляется ещё один отдельный блок:
NPU — Neural Processing Unit.
Нейропроцессор.
Он предназначен именно для операций, из которых состоят нейросети.
Теоретически модель можно гонять и на CPU.
Можно жарить яичницу строительным феном.
Вопрос — зачем.
NPU выполняет такие вычисления быстрее и, что для смартфона особенно важно, экономнее по энергии.
Qualcomm сейчас называет локальный AI одной из центральных возможностей Snapdragon. В нынешних мобильных платформах Hexagon NPU отвечает за генеративные модели, мультимодальное распознавание и персональные AI-функции прямо на устройстве.
То есть гонка смартфонных процессоров больше не только про:
сколько баллов в Geekbench?
Теперь отдельный вопрос:
какую нейросеть этот телефон способен нормально запустить?
Правда, слово «нормально» здесь очень важное
Можно прочитать рекламный буклет:
Наш смартфон запускает большую языковую модель!
И представить ChatGPT целиком, упакованный в телефон.
Не совсем.
Большая облачная система может занимать сотни гигабайт памяти и работать на кластере из огромного количества ускорителей.
В телефоне:
несколько ватт доступной мощности;
маленький корпус;
ограниченная память;
аккумулятор;
и пользователь, который очень удивится, если после пятнадцати минут разговора с ИИ смартфоном можно будет жарить котлеты.
Поэтому мобильные модели приходится ужимать.
Сокращать количество параметров.
Использовать квантование.
Оптимизировать архитектуру.
Специализировать под конкретные задачи.
И здесь появляется цена локальности.
Маленькая модель обычно глупее большой
Не всегда и не во всём.
Для простой задачи специализированная маленькая модель может работать великолепно.
Исправить сообщение.
Сделать короткое резюме.
Выделить имена из текста.
Описать фотографию.
Распознать речь.
Для этого совершенно необязательно вызывать гигантскую модель из дата-центра.
Но попросите мобильную модель:
Прочитай договор на 120 страниц, сравни его с четырьмя законами, найди противоречия и составь юридическую позицию.
Телефон может слегка задуматься о смысле своего существования.
😁
Apple очень наглядно показывает эту границу в собственной архитектуре.
Локальная системная модель имеет контекст около 4 тысяч токенов и предназначена для относительно компактных задач. Для более сложных запросов Apple предлагает серверную модель Private Cloud Compute с контекстом до 32 тысяч токенов и более сильным reasoning.
То есть даже Apple фактически говорит:
простое делаем здесь;
тяжёлое — отправляем наружу.
И это, скорее всего, главная архитектура ближайших лет.
Будущее не локальное и не облачное. Оно гибридное
Представьте обычного AI-ассистента.
Вы говорите:
Напомни завтра в девять позвонить Сергею.
Зачем для этого обращаться к гигантской модели в дата-центре?
Телефон сам понял намерение.
Нашёл контакт.
Создал напоминание.
Теперь:
Проанализируй рынок недвижимости Ставрополя за последние три года и скажи, где сейчас интереснее покупать помещение.
Вот здесь понадобятся:
актуальный интернет;
поиск;
много источников;
большой контекст;
сильное рассуждение.
Пусть идёт в облако.
Следующий запрос:
А теперь добавь результат в мою заметку.
Опять локально.
Получается цепочка:
локальный ИИ → облачный ИИ → локальный ИИ.
Причём пользователь вообще не обязан видеть переключение.
Он разговаривает с одним помощником.
А система сама решает, где выгоднее выполнить каждый кусок работы.
Apple уже буквально строит такой переключатель
В новой Foundation Models framework разработчик может работать через единый интерфейс с разными моделями.
Локальной Apple Foundation Model.
Моделью в Private Cloud Compute.
Сторонней облачной моделью.
Собственной локальной моделью.
Apple в документации прямо предлагает сначала попробовать выполнить задачу на устройстве, а если не хватает reasoning или контекста — переключиться на серверную модель.
Это, на мой взгляд, куда важнее очередного рейтинга:
какая нейросеть сейчас самая умная?
Будущий AI-сервис вообще может не иметь одной нейросети.
Под капотом будет несколько.
Маленькая.
Большая.
Зрительная.
Голосовая.
Локальная.
Облачная.
А пользователь получает один интерфейс.
Android идёт примерно туда же
У Google локальная часть — Gemini Nano через AICore.
Для более сложных задач разработчик может использовать облачные Gemini.
В свежей серии для Android Google прямо разделяет архитектуру на on-device inference и hybrid/cloud reasoning: компактные персональные задачи предлагается делать локально, а доступ к вебу, картам и более сложному рассуждению — переносить в облако.
То есть два крупнейших производителя мобильных платформ независимо приходят примерно к одному выводу.
Отправлять каждый запрос в дата-центр — расточительно.
Но пытаться засунуть весь дата-центр в телефон — тоже глупо.
Нужно разделять работу.
Это очень похоже на человеческую память
Вы же не решаете каждую задачу через Google.
Как вас зовут?
Не ищете.
Где лежит чашка?
Не ищете.
Что вы делали пять минут назад?
Обычно тоже знаете сами.
А вот:
сколько жителей было в Константинополе в XI веке?
Тут уже открываем внешний источник.
С локальным ИИ будет похожая система.
Телефон знает:
ваш личный мир.
Облако знает:
огромный внешний мир.
И хороший ассистент соединяет два уровня.
Вот это уже намного интереснее, чем просто ещё один чат-бот.
Причём телефон имеет данные, которых облачная модель сама по себе вообще не видит
Камера.
Микрофон.
Геолокация.
Акселерометр.
Контакты.
Приложения.
Экран.
Уведомления.
Bluetooth-устройства.
История действий.
Умные часы.
В перспективе очки.
Наушники.
Машина.
Телефон находится в центре довольно большого цифрового организма человека.
Поэтому именно локальный ИИ потенциально способен понять контекст:
где человек;
что делает;
на что смотрит;
с кем говорит;
какое приложение открыто.
Отправлять весь этот непрерывный поток в облако и дорого, и страшновато с точки зрения приватности.
А локальная модель может отфильтровать информацию.
В облако уйдёт только то, что действительно нужно.
Получается своего рода AI-фильтр перед интернетом
Это может стать одной из важнейших функций локального ИИ.
Например, пользователь спрашивает:
Когда мне удобно встретиться с Иваном?
Телефон локально анализирует календарь.
Не отправляет в облако расписание:
врач — понедельник;
встреча с бухгалтером — вторник;
день рождения жены — четверг;
ещё двадцать личных событий.
Вместо этого наружу можно передать только:
свободные интервалы: вторник 15–17, среда 11–13.
Большая модель получила достаточно данных для ответа.
А всё лишнее осталось дома.
Это уже не просто:
локальная нейросеть быстрее.
Это архитектура приватного AI-ассистента.
Правда, надпись «AI работает локально» сама по себе ничего не гарантирует
Тут маркетологи тоже обязательно найдут пространство для творчества.
Допустим, модель действительно обработала фотографию на телефоне.
А затем приложение отправило результат, метаданные и историю запроса на свой сервер.
Технически производитель может написать:
AI inference выполняется on-device.
И не соврать.
Но приватным весь продукт от этого автоматически не становится.
Поэтому важен не один вопрос:
где работает модель?
А весь маршрут данных:
что читается;
что сохраняется;
что отправляется;
кому;
на какой срок.
Локальный ИИ даёт возможность построить приватную систему.
Но не заставляет разработчика так поступать.
Есть ещё батарея
Облако имеет довольно приятное преимущество.
Его электричество находится далеко от вас.
😁
Если ChatGPT полчаса думает на сервере, батарея телефона в основном тратится на связь и экран.
Если огромная модель полчаса работает прямо на устройстве, вычисления оплачивает аккумулятор.
Плюс появляется тепло.
Поэтому производители так много говорят не просто о производительности NPU, а о performance per watt — количестве работы на ватт энергии.
Qualcomm, например, отдельно подчёркивает рост производительности NPU одновременно с повышением энергоэффективности новых Snapdragon.
Для компьютера можно поставить вентилятор побольше.
С телефоном сложнее.
Никто не хочет доставать из кармана маленькую печку.
И память тоже не бесконечная
Модель нужно где-то хранить.
А современные модели даже после оптимизации могут занимать гигабайты.
Google поэтому сделала AICore системным компонентом: приложения не таскают каждая свою копию Gemini Nano, а используют общую модель, которой управляет Android.
Это очень разумно.
Иначе получится:
мессенджер скачал свою нейросеть — 4 ГБ;
заметки — ещё 5;
камера — ещё 3;
календарь — 4;
закончилась память телефона.
Пользователь:
Ничего себе искусственный интеллект.
Удалил всё.
😁
Системная модель может обслуживать сразу множество приложений.
И это ещё один признак, что ИИ постепенно становится частью операционной системы, а не отдельным приложением.
Вот это, пожалуй, самое большое изменение
Сегодня нейросеть ассоциируется с иконкой.
Открыли ChatGPT.
Открыли Claude.
Открыли Gemini.
Написали запрос.
Но через несколько лет AI может стать похож на GPS.
Вы ведь не думаете:
сейчас я воспользуюсь технологией спутниковой навигации.
Просто открываете такси.
Или карты.
Или приложение доставки.
GPS уже внутри.
Так же будет с локальными моделями.
Открыли почту — ИИ сам выделил важное.
Открыли диктофон — сделал резюме.
Сфотографировали документ — понял содержание.
Открыли календарь — нашёл конфликт.
Написали сообщение — предложил вариант.
Навели камеру на предмет — объяснил, что это.
Вы не запускали «нейросеть».
Она просто была в телефоне.
И тогда исчезнет ещё один сегодняшний вопрос
Сейчас люди спрашивают:
Какая у тебя нейросеть?
ChatGPT?
Claude?
Gemini?
DeepSeek?
В будущем ответ может звучать довольно странно:
все понемногу.
Локальная модель телефона прочитала запрос.
Специализированная модель распознала изображение.
Облачная решила сложную часть.
Поисковая система дала свежие данные.
Локальная модель снова обработала результат с учётом ваших личных настроек.
Пользователь ничего этого не видел.
Он просто спросил:
Что мне приготовить из того, что лежит в холодильнике?
И получил ответ.
Побеждать будет не обязательно тот, у кого одна самая умная модель.
А тот, кто лучше соединит разные модели в незаметную систему.
Поэтому локальный ИИ вовсе не собирается убивать облачные нейросети
Скорее наоборот.
Он снимает с них огромный слой мелкой работы.
Зачем тратить дата-центр на исправление опечатки?
На классификацию уведомления?
На описание фотографии?
На краткое резюме двух абзацев?
На распознавание простой команды?
Пусть телефон сделает сам.
А дорогая большая модель занимается тем, где её возможности действительно нужны.
Это почти как компания.
Генеральный директор не должен лично отвечать:
где лежат скрепки?
Для этого есть система попроще.
И здесь мобильный рынок может неожиданно сильно изменить всю экономику ИИ
Сегодня крупнейшие AI-компании тратят колоссальные деньги на дата-центры.
Но одновременно в мире уже находятся миллиарды устройств с процессорами.
Телефоны.
Ноутбуки.
Машины.
Камеры.
Телевизоры.
Роботы.
Если часть inference перенести туда, появляется гигантская распределённая вычислительная инфраструктура, которую производителю AI не нужно целиком строить самостоятельно.
Каждый пользователь уже купил себе маленький AI-компьютер.
Qualcomm утверждает, что её AI Engine уже поставлен более чем в два миллиарда устройств разных типов.
Разумеется, старый телефон не превратится от этого в полноценный ChatGPT.
Но сам масштаб аппаратной базы впечатляет.
А для роботов локальный ИИ вообще будет обязательным
Мы последние дни много говорили о гуманоидных роботах.
Представьте машину, которая идёт по лестнице.
Камера увидела ступеньку.
Отправила кадр в облако.
Ждём.
Сервер ответил:
поднимите левую ногу.
Связь пропала.
Робот:
Ну всё.
Полёт.
😁
Критические системы восприятия и движения обязаны работать локально.
Облако может помогать обучать модель.
Давать сложные знания.
Планировать долгую задачу.
Но баланс, зрение, безопасность и базовое понимание среды не могут зависеть от Wi-Fi соседа.
С телефоном требования мягче.
Принцип тот же.
Чем ближе AI становится к реальному миру, тем важнее часть интеллекта держать на самом устройстве.
Так зачем всё-таки нейросеть внутри телефона?
Не чтобы похвастаться:
мой смартфон запускает модель с десятью миллиардами параметров.
Через несколько лет большинству людей вообще будет плевать на количество параметров.
Локальный ИИ нужен потому, что он способен делать четыре вещи, с которыми облако принципиально справляется хуже:
работать мгновенно; работать без сети; не отправлять лишние личные данные наружу; не выставлять серверу счёт за каждое мелкое действие.
А облако останется там, где нужны огромные модели, свежие знания, длинный контекст и тяжёлые вычисления.
Поэтому мы, скорее всего, вообще неправильно задаём вопрос:
Что победит — локальный ИИ или облачный?
Ничего не победит.
Они поделят работу.
И в идеальном варианте пользователь даже перестанет понимать, где именно сейчас думает его нейросеть.
Телефон сам решит:
это я могу сделать здесь.
А через секунду:
нет, тут позову старшего.
И вот тогда искусственный интеллект окончательно перестанет быть отдельным сайтом, куда мы ходим поговорить с очень умным компьютером.
Он станет обычной частью устройства.
Такой же незаметной, как GPS, камера или Wi-Fi.
Только немного разговорчивее.