Нейросеть прямо в телефоне: зачем запускать ИИ локально, если есть облако

Последние пару лет нас приучили к очень простой схеме.

Вы пишете запрос.

Телефон отправляет его куда-то в огромный дата-центр.

Там на тысячах GPU живёт умная нейросеть.

Через несколько секунд ответ возвращается обратно.

Работает прекрасно.

И возникает совершенно логичный вопрос:

зачем вообще пытаться запихнуть искусственный интеллект внутрь телефона, ноутбука, автомобиля или робота, если в облаке модель всё равно будет мощнее?

Вопрос хороший.

Потому что локальный AI почти всегда проигрывает облачному по абсолютной мощности.

В телефоне нет стойки NVIDIA.

Нет сотен гигабайт памяти.

Нет киловаттов электричества.

И тем не менее Apple, Google, Qualcomm, Samsung, Microsoft и практически вся индустрия сейчас вкладывают огромные деньги именно в on-device AI.

Причина проста.

Будущее, скорее всего, вообще не выберет между локальным AI и облаком.

Оно разделит интеллект между ними.

Начнём с главной проблемы облака: ему нужен интернет

Звучит смешно в 2026 году.

Интернет вроде везде.

Но ровно до того момента, когда:

вы зашли в лифт;

спустились в подвал;

едете по трассе;

летите в самолёте;

находитесь за городом;

оператор решил провести профилактику;

сервер решил провести собственную профилактику.

И внезапно ваш невероятно умный AI превращается в:

Не удалось подключиться.

Для обычного чат-бота это неприятно.

Для робота или автомобиля — уже странно.

Представьте гуманоид, который держит кастрюлю и говорит:

Извините, соединение потеряно. Попробуйте приготовить суп позже.

😁

Некоторые решения просто обязаны приниматься локально.

Особенно если время измеряется миллисекундами

Вы разговариваете с облачной моделью.

Запрос ушёл.

Сеть.

Сервер.

Inference.

Ответ обратно.

Даже если всё происходит быстро, задержка существует.

Для текста это нормально.

Сто миллисекунд никто не заметил.

Полсекунды тоже переживём.

Но теперь AI управляет камерой.

Обрабатывает голос.

Следит за жестом.

Помогает роботу удерживать равновесие.

Распознаёт препятствие перед автомобилем.

Там фраза:

подождём ответа дата-центра

начинает звучать тревожно.

Поэтому локальный AI нужен не только ради удобства.

Иногда физический мир просто быстрее интернета.

Смартфоны уже давно используют AI локально. Просто мы перестали это замечать

Камера распознаёт сцену.

Улучшает фотографию.

Выделяет лицо.

Убирает шум.

Стабилизирует изображение.

Телефон распознаёт голосовую команду.

Предсказывает слово на клавиатуре.

Определяет подозрительный звонок.

Размывает фон.

Часть подобных функций использует машинное обучение на устройстве уже много лет.

Мы просто не называли это:

мой персональный локальный искусственный интеллект.

Потому что функция стала обычной.

Сейчас меняется масштаб.

Локальные модели начинают не только распознавать.

Они начинают генерировать.

В телефон постепенно переезжают языковые модели

Пока они значительно меньше облачных гигантов.

Это нормально.

Если большая модель имеет сотни миллиардов параметров, просто взять её и установить на смартфон не получится.

Но для огромного количества задач такая модель вообще не нужна.

Допустим, требуется:

переписать предложение;

сделать краткое содержание;

вытащить дату из письма;

классифицировать уведомление;

найти нужную информацию в заметках;

понять простую голосовую команду;

сформировать короткий ответ.

Зачем отправлять всё это на огромный сервер?

Это примерно как вызывать грузовой самолёт, чтобы привезти батон из магазина.

Маленькие модели становятся удивительно способными

Вот что особенно сильно изменилось.

Ещё несколько лет назад маленькая языковая модель означала:

ну… она хотя бы что-то отвечает.

Сегодня модели в несколько миллиардов параметров уже способны вполне прилично:

понимать инструкции;

суммировать документы;

извлекать данные;

работать с простым кодом;

вести базовый диалог;

классифицировать информацию.

Они не заменяют флагманскую Astra, Claude или сильный GPT на действительно сложной задаче.

Но им этого и не нужно.

Локальная модель может быть первой линией интеллекта.

А тяжёлая работа уходит в облако только тогда, когда действительно требуется.

Примерно как у человека

Чтобы открыть дверь, вы не собираете консилиум профессоров.

Мозг выполняет простое действие локально.

А если внезапно нужно решить сложную научную проблему — подключается гораздо больше ресурсов.

У AI начинает появляться похожая архитектура.

Маленькая модель:

понимаю, это простая задача. Сделаю здесь.

Сложный запрос:

нет, тут нужен большой мозг.

Отправляем в облако.

Это намного рациональнее, чем каждый раз запускать огромную модель ради команды:

поставь будильник на семь утра.

Вторая огромная причина — приватность

Представьте AI, который действительно знает вас хорошо.

Не пять сообщений текущего чата.

А:

почту;

фотографии;

историю сообщений;

календарь;

контакты;

заметки;

файлы;

местоположение;

голос;

данные здоровья;

рабочие документы.

Вот тогда ассистент становится действительно полезным.

Можно сказать:

Найди фотографию договора, который Миша присылал мне после встречи в августе, и напомни, что там было по срокам.

Для выполнения такой задачи системе нужно очень много личного контекста.

И сразу возникает вопрос:

мы точно хотим постоянно отправлять всё это в облако?

Даже при хорошем шифровании и нормальной политике компании идея имеет очевидные риски.

Локальный AI позволяет приблизить интеллект к данным

Не данные едут к модели.

Модель приезжает к данным.

Фотографии остаются на телефоне.

Сообщения там же.

Календарь тоже.

Локальная модель может проиндексировать информацию и выполнить часть операций, не отправляя содержимое наружу.

Для пользователя это хороший privacy-бонус.

Для бизнеса — иногда вообще необходимое условие.

Есть документы, которые компания просто не хочет передавать внешнему AI-провайдеру.

Контракты.

Клиентские данные.

Исходный код.

Персональная информация.

Коммерческие секреты.

Тогда локальная или private-cloud модель внезапно становится намного привлекательнее, даже если немного уступает по качеству.

Потому что лучший AI — не всегда самый умный

Это вообще важная мысль.

Допустим, модель А отвечает правильно в 98% случаев.

Но данные нужно отправлять внешнему провайдеру.

Модель Б даёт 94%, зато работает локально, стоит почти ничего на запрос и не выводит данные за пределы устройства.

Какая лучше?

Зависит от задачи.

В корпоративном мире ответ может легко оказаться:

Б.

Мы привыкли смотреть на benchmark.

Бизнес смотрит ещё на:

стоимость;

скорость;

приватность;

контроль;

устойчивость;

регуляторные риски.

И здесь маленькая локальная модель неожиданно начинает выигрывать у гиганта.

Третья причина — деньги

Облачный AI не материализуется бесплатно.

Каждый запрос — вычисления.

Каждый входной токен.

Каждый выходной.

Каждая картинка.

Каждая секунда видео.

Когда пользователей сто — никого не волнует.

Когда сто миллионов — всё меняется.

Представьте операционную систему телефона, которая постоянно использует AI.

Не десять запросов пользователя в день.

А тысячи маленьких операций:

классификация;

поиск;

суммаризация;

распознавание;

предсказание;

обработка фотографии;

контекст ассистента.

Если каждую такую мелочь отправлять в дата-центр, производитель получает очень интересный счёт за GPU.

😁

Локальный inference после покупки устройства почти ничего не стоит компании на каждую дополнительную операцию.

Электричество платит пользователь.

Чип уже куплен.

Вот зачем в смартфонах появились NPU

Современный процессор давно состоит не только из CPU и GPU.

Появился ещё один важный блок — NPU, Neural Processing Unit.

Специализированный ускоритель для нейросетевых вычислений.

Он умеет выполнять определённые матричные операции значительно эффективнее обычного процессора.

Меньше расходовать энергии.

Меньше греться.

Быстрее считать типичные AI-задачи.

Такие блоки сегодня есть в огромном количестве смартфонов и ноутбуков.

Причём производители всё чаще рекламируют уже не только гигагерцы.

Теперь ещё:

столько-то TOPS AI-производительности.

Ещё несколько лет назад обычный покупатель вообще не знал, зачем это число существует.

Скоро будет примерно как с камерой.

Но телефон всё равно имеет жестокое ограничение — батарею

Дата-центр может потреблять мегаватты.

Телефон хочется использовать до вечера.

Поэтому локальный AI обязан быть чрезвычайно экономным.

Нельзя каждую минуту запускать гигантскую модель на полную мощность.

Она:

разрядит аккумулятор;

нагреет корпус;

сделает пользователя несчастным.

Отсюда огромный интерес к оптимизации.

Quantization.

Pruning.

Distillation.

Mixture-of-experts.

Маленькие специализированные модели.

Всё это звучит как очень техническая скука.

На самом деле именно эти технологии определяют, какой AI сможет жить у нас в кармане.

Quantization особенно хорошо показывает происходящее

Модель хранит огромное количество числовых весов.

Чем точнее каждое число, тем больше требуется памяти и вычислений.

Но нейросети часто не нужна невероятная математическая точность каждого отдельного веса.

Можно представить значения более компактно.

Например, использовать меньше бит.

Модель становится меньше.

Быстрее.

Экономичнее.

Иногда качество снижается совсем немного.

Получается крайне выгодный обмен.

Не:

максимально умная модель.

А:

достаточно умная модель, которая влезает в телефон и не съедает аккумулятор за сорок минут.

Дистилляция делает ещё более странную вещь

Большая модель обучает маленькую.

Условно:

профессор объясняет множество задач ученику.

Ученик не получает весь интеллект профессора.

Но перенимает значительную часть полезных закономерностей.

В итоге маленькая модель становится намного сильнее, чем была бы при обычном обучении.

Именно поэтому сегодняшние компактные модели начинают выглядеть так впечатляюще.

В них постепенно «упаковывают» знания и поведение больших систем.

Получается любопытный цикл.

Огромные дата-центры учат гигантов.

Гиганты помогают создавать маленькие модели.

А маленькие модели потом уезжают на миллиарды устройств.

И локальный AI не обязательно означает полностью автономный AI

Это тоже важно.

Есть популярная крайность:

либо всё в облаке, либо всё работает на телефоне.

Необязательно.

Можно разделить задачу.

Телефон анализирует личные данные локально.

Создаёт безопасное краткое представление.

Отправляет в облако только то, что действительно нужно большой модели.

Получает ответ.

Локально объединяет его с приватным контекстом.

Такой hybrid AI выглядит сейчас наиболее реалистичным направлением.

Потому что использует лучшее из обоих миров.

Например, вы спрашиваете: «Когда мне лучше встретиться с Ником?»

Локальная система видит ваш календарь.

Знает историю переписки.

Определяет свободные окна.

Для этого нет необходимости передавать весь календарь внешнему серверу.

Если вопрос простой, она вообще отвечает сама.

Если нужно:

учти перелёт, прогноз погоды, расписание конференции и подбери ресторан,

часть задачи можно передать мощному облачному агенту.

Но ему не обязательно отдавать все ваши письма за последние десять лет.

Вот такая архитектура выглядит значительно здоровее.

Apple как раз очень сильно толкает идею гибридного AI

И это логично для компании, десятилетиями строившей свою публичную позицию вокруг приватности и контроля устройства.

Часть задач выполняется непосредственно на iPhone, iPad или Mac.

Если локальной мощности недостаточно, запрос может уходить в защищённую серверную инфраструктуру.

Главный принцип интересен не конкретной реализацией Apple.

А самим направлением:

сначала попробуй сделать рядом с пользователем, потом проси облако.

Мне кажется, именно так постепенно будут устроены практически все персональные AI.

Android движется туда же

Google развивает компактные модели семейства Gemini Nano для on-device сценариев.

Qualcomm строит мобильные платформы вокруг локального генеративного AI.

Samsung интегрирует часть AI-функций непосредственно на устройство.

Производители ноутбуков продают отдельную категорию AI PC.

Microsoft строит вокруг NPU всё больше системных функций.

То есть это уже не эксперимент одной компании.

Вся индустрия пришла примерно к одной и той же мысли:

невозможно строить персональный AI только на удалённом дата-центре.

Часть мозга должна жить рядом.

Особенно если AI должен быть постоянно включён

Сегодня мы сами обращаемся к модели.

Открыли ChatGPT.

Написали.

Закрыли.

Будущий ассистент должен работать иначе.

Он постоянно понимает контекст.

Вы получили письмо.

Он знает.

Началась встреча.

Он знает.

Вы сфотографировали документ.

Он знает.

Появилась задача.

Он знает.

Такая система потенциально выполняет тысячи небольших AI-операций фоном.

Отправлять каждую в облако — дорого, медленно и неприятно с точки зрения приватности.

Локальная модель становится чем-то вроде дежурного мозга.

И тут возникает интересная многоуровневая архитектура

Первый уровень — совсем маленькие специализированные модели.

Они работают постоянно.

Распознавание голоса.

Классификация.

Видение.

Второй — локальная языковая модель.

Она понимает пользовательские команды и личный контекст.

Третий — облачная сильная модель.

Подключается для тяжёлого reasoning.

Четвёртый — специализированные облачные инструменты.

Видео.

Изображения.

Исследования.

Код.

Получается уже не одна нейросеть.

А иерархия интеллектов.

И пользователь вообще не обязан знать, какая модель в данный момент что сделала.

Мы уже обсуждали похожую вещь на примере Mostik

Там большая модель помогает маленькой через скрытые состояния.

Здесь концепция немного другая, но направление похожее.

Не обязательно заставлять один гигант выполнять абсолютно всё.

Можно распределить работу.

Маленькая модель рядом.

Большая далеко.

Специализированная — по необходимости.

Вот здесь мне кажется особенно смешной сегодняшняя религиозная война:

GPT лучше Claude!

Claude лучше Gemini!

Через несколько лет одно приложение может использовать их аналоги одновременно.

А пользователь вообще об этом не узнает.

Но зачем тогда человеку облачные агрегаторы вроде Syntx?

И вот здесь два подхода отлично дополняют друг друга.

Локальный AI великолепен для:

личного контекста;

простых задач;

приватных данных;

быстрых реакций;

работы без сети.

Но невозможно запихнуть в телефон все лучшие модели мира.

Генератор видео.

Сильный reasoning.

Продвинутую генерацию изображений.

Специализированные музыкальные модели.

Большой веб-поиск.

Десятки сервисов.

Для этого облако всё равно останется.

Именно поэтому я сам пользуюсь подходом, где разные мощные инструменты собраны в одном месте — например, в Syntx AI сейчас больше сотни нейроинструментов в одной подписке без необходимости отдельно покупать доступ к каждому сервису.

Локальная модель и такой агрегатор вообще не конкуренты.

Один становится персональным ближним интеллектом.

Второй — тяжёлой внешней артиллерией.

В идеальном будущем пользователь вообще не должен решать, куда отправлять задачу

Сегодня мы думаем:

это лучше сделать в ChatGPT.

картинку — в другом сервисе.

видео — в третьем.

локально такую модель запустить или через API?

С точки зрения нормального интерфейса это ужасно.

Компьютер должен сам понимать:

простая задача — локально;

приватная — локально;

сложная, но обезличенная — облако;

нужна картинка — визуальная модель;

нужен огромный контекст — сильная серверная;

нет интернета — работаем тем, что есть.

Пользователь говорит только:

сделай.

Вот это уже настоящий AI-ассистент.

Локальный AI особенно важен для роботов

Возвращаемся к нашей любимой теме.

Робот не может полностью зависеть от облака.

Он идёт по квартире.

Интернет исчез.

Что дальше?

Стоять?

Падать?

Отказаться отпускать чашку?

Базовое восприятие мира, баланс, безопасность, распознавание объектов и низкоуровневое планирование должны оставаться локальными.

Более сложный интеллект может быть гибридным.

Что передо мной?

Локально.

Как безопасно поставить кружку?

Локально.

Найди рецепт настоящего грузинского харчо и адаптируй под мои продукты.

Можно в облако.

Такая архитектура очевидна.

То же самое с автомобилями

Камеры увидели пешехода.

Автомобиль не должен спрашивать сервер:

тормозим?

Тем более если машина находится в тоннеле.

Критические решения принимаются на борту.

Облако используется для:

обновлений;

обучения;

карт;

дополнительной информации;

аналитики.

Это хороший пример того, как AI естественно распределяется между устройством и центром обработки данных.

Причём пользователь об этой архитектуре вообще не думает.

Машина просто едет.

Для домашнего компаньона локальный AI даёт ещё одно важное преимущество — непрерывность личности

Мы недавно разбирали проблему:

вы купили робота, а его характер принадлежит серверу производителя.

Вот здесь локальная модель потенциально меняет всё.

Представьте, что память робота хранится дома.

Основные предпочтения.

История отношений.

Голосовой профиль.

Личностные настройки.

Даже базовая разговорная модель.

Компания исчезла?

Робот не превращается мгновенно в мебель.

Он может стать чуть менее умным.

Потерять новые знания.

Но продолжает помнить вас.

Для companion-систем это потенциально огромная ценность.

Правда, локальный AI создаёт и новые проблемы

Если модель работает в облаке, разработчик обновил сервер.

Всё.

Миллионы пользователей получили новую версию.

Если модель скачана на устройство, нужно:

доставить обновление;

учесть разные чипы;

разную память;

разную производительность;

старые телефоны;

батареи;

ошибки совместимости.

Получается знакомый кошмар программной разработки.

Поддерживать один сервер намного проще, чем миллиард разного железа.

Поэтому облако никуда не исчезнет ещё и по этой причине.

Ещё одна проблема — размер памяти

Даже относительно небольшая модель может занимать несколько гигабайт.

А пользователь одновременно хочет:

фотографии;

игры;

видео;

приложения;

музыку.

И тут операционная система сообщает:

Для умного ассистента требуется ещё 18 ГБ.

Пользователь:

Нет.

😁

Поэтому локальные модели будут конкурировать буквально за место на устройстве.

Станет важен не только benchmark.

А:

сколько интеллекта помещается в один гигабайт?

Очень интересная новая метрика.

Следующая проблема — обновление знаний

Облачная модель легко имеет доступ к свежей информации.

Локальная модель скачана месяц назад.

Она не знает, что произошло вчера.

Здесь снова появляется гибридная схема.

Сам интеллект локальный.

Свежие данные приходят через поиск или маленький сетевой запрос.

То есть модель не обязана хранить весь интернет внутри себя.

Ей нужно хорошо понимать запрос и уметь получать данные по необходимости.

Это ещё одна причина, почему AI постепенно превращается из одного огромного мозга в систему компонентов.

А иногда локальный AI вообще не должен быть универсальным

Это, думаю, очень важное направление.

Зачем ставить в камеру языковую модель, которая знает Шекспира?

Камере нужен AI для изображения.

Роботу — модель управления.

Наушникам — речь.

Клавиатуре — предсказание текста.

Умному дому — понимание команд.

Маленькие специализированные модели могут быть значительно эффективнее универсальной.

Получается почти возвращение к старому софту.

Только вместо программ мы ставим узких маленьких интеллектов.

А над ними может работать один общий ассистент.

И в этом месте становится понятна настоящая ценность NPU

Он не обязательно нужен, чтобы запустить «ChatGPT внутри телефона».

Это слишком узкое представление.

NPU нужен, чтобы вся операционная система стала немного AI-native.

Камера.

Звук.

Поиск.

Интерфейс.

Доступность.

Безопасность.

Приложения.

Всё постепенно получает небольшие модели.

Нейросеть перестаёт быть отдельным приложением.

Она растворяется внутри компьютера.

И это намного серьёзнее появления ещё одного чат-бота.

Через несколько лет мы, вероятно, вообще перестанем спрашивать: «Эта функция использует AI?»

Сегодня модно клеить:

AI-powered.

На холодильник.

На зубную щётку.

Ещё немного — на тапочки.

😁

Потом термин станет таким же бессмысленным, как:

этот телефон использует алгоритмы.

Конечно использует.

Локальные нейросети будут просто частью вычислительного стека.

Где-то заменят обычный алгоритм.

Где-то дополнят.

Где-то вообще останутся незаметными.

Вот тогда AI действительно станет инфраструктурой.

И облако при этом станет ещё больше

Это забавный парадокс.

Кажется:

если всё переезжает на устройства, дата-центров нужно меньше.

Скорее всего, нет.

Потому что локальные модели тоже нужно:

обучать;

дистиллировать;

тестировать;

обновлять.

Плюс количество AI-сценариев резко растёт.

Часть работы уходит на телефон, но пользователь начинает использовать AI в десять раз чаще.

И общая потребность в вычислениях может продолжить увеличиваться.

Примерно как Wi-Fi не уничтожил мобильные сети.

Он просто позволил людям пользоваться интернетом ещё больше.

Поэтому сегодняшняя гонка AI-чипов в телефонах совсем не игрушечная

Производители фактически борются за право стать платформой для следующего поколения приложений.

Если телефон способен быстро запускать модели локально, разработчики начинают строить вокруг этого новые функции.

Если нет — приложение остаётся зависимым от облака.

Получается новый слой конкуренции.

Когда-то важным было:

есть ли хорошая камера?

Потом:

сколько GPU?

Теперь:

какие модели реально можно запускать прямо на устройстве?

И разрыв постепенно будет становиться заметным пользователю.

Особенно когда появятся по-настоящему персональные модели

Вот это мне кажется самым интересным.

Облачная модель знает человечество.

Локальная может знать конкретно вас.

Ваш язык.

Ваши привычки.

Манеру письма.

Контакты.

Проекты.

Историю.

Предпочтения.

Не обязательно обучаться полностью на ваших данных.

Достаточно локальной памяти и персонального контекста.

Тогда телефон перестаёт быть просто устройством, на котором открыт AI.

AI становится частью самого телефона.

И здесь появляется немного тревожный сценарий

Через пять лет вы меняете смартфон.

Сегодня переносим:

фотографии;

контакты;

приложения.

Завтра добавится:

перенести моего AI.

Не программу.

А накопленную память.

Предпочтения.

Историю.

Персональную модель поведения.

Получится что-то вроде цифрового профиля личности.

И потеря телефона станет означать уже не только потерю файлов.

Можно потерять годы персонализации.

Поэтому резервное копирование AI-памяти внезапно станет отдельной индустрией.

И тогда вопрос «локально или в облаке?» станет почти философским

Если личность ассистента хранится только локально — пользователь контролирует её.

Но устройство можно потерять.

Если всё в облаке — данные устойчивее.

Но контролирует их компания.

Вероятнее всего, снова победит гибрид.

Зашифрованная персональная память.

Часть на устройстве.

Защищённая резервная копия.

Большие модели — внешние.

Критическая персонализация — под контролем пользователя.

Такой баланс кажется наиболее естественным.

А что насчёт полностью локального ChatGPT уровня флагмана?

Когда-нибудь — вполне возможно.

Но к тому моменту облачные модели тоже не будут стоять на месте.

Это вечная гонка.

Телефон 2030 года способен локально запускать модель уровня хорошего AI 2026-го.

Но дата-центр 2030 года запускает систему, которая значительно сильнее.

Поэтому облако всегда сможет предложить больше вычислений, чем устройство в кармане.

Физику не обманешь.

Вопрос не:

догонит ли телефон дата-центр?

Не догонит.

Вопрос:

для какой доли повседневных задач дата-центр вообще не понадобится?

Вот эта доля будет постоянно расти.

Я думаю, она окажется огромной

Большинство наших действий довольно простые.

Напомнить.

Найти.

Перевести.

Объяснить уведомление.

Вытащить данные из документа.

Исправить предложение.

Найти фотографию.

Суммировать письмо.

Распознать объект.

Организовать заметки.

Для этого не нужен интеллект, способный решать FrontierMath.

И когда локальная модель становится достаточно хорошей, выгоды очевидны:

мгновенно;

дёшево;

приватно;

работает без сети.

Трудно отказаться.

Поэтому мощные облачные модели не исчезнут. Они станут чем-то вроде специалистов

Локальный AI — семейный врач.

Знает вас.

Всегда рядом.

Решает большинство обычных вопросов.

Облачная флагманская модель — специализированный центр.

Нужна серьёзная задача?

Отправляем туда.

Исследование.

Сложный код.

Большой анализ.

Видео.

Сотни документов.

Такой подход вообще экономически намного логичнее.

Не использовать самый дорогой интеллект там, где справляется маленький.

Мы уже пришли к точно такой же логике в моём собственном автоматизированном конвейере.

Разные модели — разные работы.

Возможно, через несколько лет само понятие «моя нейросеть» изменится

Сегодня человек говорит:

я пользуюсь ChatGPT.

Или:

Claude.

Или:

Gemini.

В будущем ответ может звучать странно.

Какая у тебя нейросеть?

Понятия не имею.

Потому что одна работает локально.

Вторая подключается для сложных задач.

Третья делает картинки.

Четвёртая — видео.

Пятая управляет автомобилем.

Все они скрыты за одним интерфейсом.

И это, на мой взгляд, значительно здоровее нынешнего зоопарка приложений.

Самый хороший AI вообще должен постепенно исчезнуть

Не заставлять пользователя каждый раз:

открыть нейросеть.

Вы просто работаете.

Пишете.

Фотографируете.

Едете.

Разговариваете.

И система где-то внутри решает, нужен ли AI, какой именно и где его запустить.

Локально?

Облако?

Специализированный сервис?

Пользователь не обязан знать.

Как сегодня ему всё равно, какой именно блок процессора обработал фотографию.

Поэтому локальный AI не заменит облако

И облако не убьёт локальный AI.

Они просто займут разные этажи одной системы.

На устройстве будет жить:

быстрый;

личный;

приватный;

дешёвый интеллект.

В дата-центре:

огромный;

дорогой;

свежий;

способный решать самые тяжёлые задачи.

А между ними — маршрутизатор, который решает:

кто сейчас должен думать?

И, возможно, именно этот маршрутизатор окажется одним из самых важных компонентов следующего поколения AI.

Потому что через несколько лет вопрос будет уже не:

какая нейросеть самая умная?

А:

зачем я вообще вызвал огромную нейросеть, если мой телефон мог решить это сам за десять миллисекунд?

Вот тогда искусственный интеллект окончательно перестанет быть сайтом, куда мы ходим за ответами.

Он станет частью самого компьютера.

Такой же незаметной и обязательной, как сегодня интернет.

Только иногда интернет можно выключить.

А AI, похоже, собирается остаться прямо внутри.