
Возраст человека довольно легко узнать по голосу.
Не точно, конечно. Но ребёнка редко перепутаешь с шестидесятилетним мужчиной, а голос двадцатилетней девушки — с голосом восьмидесятилетней женщины. Мы бессознательно слышим тембр, скорость речи, паузы, интонации и ещё десятки мелких признаков.
Теперь исследователи решили передать эту работу машине.
Получилось значительно интереснее, чем простой аттракцион «угадай возраст по голосу».
ИИ научился рассчитывать так называемый речевой возраст человека. А когда этот возраст оказывался заметно выше паспортного, те же люди чаще показывали признаки ускоренного старения мозга, изменения ДНК, когнитивные нарушения и даже биомаркер болезни Альцгеймера в крови.
Причём для анализа не понадобился ни томограф, ни сложный медицинский прибор.
Достаточно нескольких минут речи.
И обычного микрофона.
На самом деле машина слушает совсем не то, что мы
Когда человек слышит пожилой голос, он обычно замечает что-нибудь очевидное.
Голос стал тише. Речь медленнее. Человек чаще делает паузы, иногда дольше подбирает слова. Тембр изменился.
Нейросеть смотрит значительно глубже.
Исследователи собрали более 700 акустических и языковых характеристик речи. Туда входят высота голоса, её изменения, скорость речи, длительность пауз, ритм, эмоциональная окраска, словарный запас, структура предложений, семантическая точность и множество параметров, которые человек на слух вообще не способен оценивать одновременно.
После этого модели дали относительно простую задачу:
по речи определить возраст человека.
То есть сначала никто не учил её искать болезнь Альцгеймера.
Не говорили:
— Вот голос больного человека, найди похожих.
Модель просто должна была понять, как звучит нормальное старение.
А затем началось самое интересное.
Если ИИ ошибался с возрастом, ошибка оказалась информативной
Допустим, человеку 65 лет.
Алгоритм слушает его и говорит:
— По речи примерно 64.
Ничего особенно удивительного.
Другому человеку тоже 65, но модель оценивает его речь как характерную для 76-летнего.
Получается разрыв:
+11 лет.
Исследователи назвали его Speech Age Gap — разрывом речевого возраста.
И сначала это можно было бы списать на обычную ошибку алгоритма. Ну не угадала машина возраст — бывает.
Но когда начали сравнивать этот разрыв с совершенно другими измерениями организма, выяснилось, что ошибка оказывается подозрительно систематической.
Человек действительно мог выглядеть биологически старше.
Исследование получилось довольно большим
В работе участвовали 2928 человек из пяти стран Латинской Америки: Аргентины, Чили, Колумбии, Мексики и Перу.
Все говорили на испанском, но выборка при этом получилась разнообразной и по странам, и по социальному происхождению, и по состоянию здоровья.
В исследование вошли здоровые люди, пациенты с лёгкими когнитивными нарушениями, болезнью Альцгеймера и разными формами лобно-височной деменции.
Это важно.
Если обучить модель только на больных и здоровых, а потом показать, что она научилась их различать, получится вполне ожидаемый классификатор.
Здесь сначала построили часы возраста, а потом посмотрели, с чем связан их ход.
И оказалось, что стрелки этих часов показывают значительно больше, чем просто число лет.
Самая очевидная связь нашлась с когнитивным состоянием
У здоровых участников речевой возраст в среднем находился ближе всего к паспортному.
У людей с когнитивными нарушениями разрыв становился больше. Ещё сильнее он проявлялся у некоторых пациентов с деменцией.
Причём полный показатель, который объединял множество особенностей речи, оказался информативнее, чем отдельные характеристики вроде скорости или высоты голоса.
Это довольно логично.
Мозг стареет не одной кнопкой.
Речь тоже не ломается в одном конкретном месте.
Человек может говорить немного медленнее, использовать менее разнообразные конструкции, иначе расставлять паузы, по-другому выражать эмоции — и каждое изменение само по себе почти ничего не значит.
А модель складывает сотни слабых сигналов.
И получает довольно устойчивый рисунок.
Потому что нормальная речь — чрезвычайно сложная задача для мозга
Мы произносим предложение и вообще не замечаем, сколько процессов сейчас произошло.
Нужно придумать мысль.
Подобрать слова.
Выстроить грамматику.
Удержать начало фразы в рабочей памяти.
Запланировать звуки.
Управлять дыханием.
Двигать гортанью, языком, губами и челюстью.
Слышать собственный голос.
Одновременно следить за реакцией собеседника и менять следующую фразу в зависимости от контекста.
Причём всё это работает практически в реальном времени.
Именно поэтому речь становится таким интересным окном в состояние мозга.
МРТ показывает структуру.
Анализ крови — определённые молекулярные процессы.
Голос показывает, как огромная система работает прямо сейчас.
И МРТ действительно подтвердило часть сигнала
У части участников были данные нейровизуализации.
Исследователи сравнили речевой возраст с так называемыми brain clocks — моделями, которые оценивают состояние мозга по его структуре и функциональным характеристикам.
И получили связь.
У ряда пациентов люди, чей голос выглядел для модели старше паспортного возраста, имели и более старый профиль мозга.
То есть одна модель слушала человека.
Другая смотрела на его мозг.
А результаты начинали сходиться.
Это уже значительно интереснее простого:
— Старики говорят медленнее.
Потому что речь начинает работать как дешёвый косвенный индикатор процессов, которые обычно изучают на гораздо более дорогом оборудовании.
Потом подключили ДНК
Есть ещё одна группа так называемых биологических часов — эпигенетические.
С возрастом меняется набор химических меток на ДНК. Сама последовательность генов при этом не переписывается, но изменяется регуляция их работы.
По определённым комбинациям таких меток исследователи научились оценивать так называемый эпигенетический возраст.
И опять возникла связь.
У здоровых участников и людей с болезнью Альцгеймера повышенный речевой возраст коррелировал с несколькими независимыми эпигенетическими часами.
То есть человек говорит в микрофон.
ИИ говорит:
— Ваша речь выглядит старше, чем должна.
Потом исследователи совершенно другим методом смотрят на метилирование ДНК.
И там тоже появляется сигнал ускоренного старения.
Разумеется, это не означает, что голос измеряет ДНК.
Но обе системы, похоже, улавливают разные проявления одного более общего процесса.
А потом в крови нашли p-tau217
Вот здесь история становится особенно интересной для исследований болезни Альцгеймера.
p-tau217 — фосфорилированный тау-белок, который сегодня рассматривается как один из сильных кровяных биомаркеров патологии Альцгеймера.
У пациентов с этим заболеванием исследователи обнаружили связь между более высоким речевым возрастом и уровнем p-tau217.
Опять совершенно разные миры.
С одной стороны — человек несколько минут разговаривает.
С другой — лабораторный анализ крови на молекулярный маркер нейродегенерации.
И между ними появляется статистическая связь.
Именно поэтому исследователи говорят уже не просто о распознавании возраста.
Речь может содержать сжатый отпечаток состояния сразу нескольких биологических систем.
Но телефон пока не диагностирует болезнь Альцгеймера
Вот здесь очень легко написать заголовок:
«ИИ определяет Альцгеймер по голосу за четыре минуты!»
И получить прекрасный CTR.
Только это будет неправдой.
Исследование в основном поперечное.
Учёные взяли людей в определённый момент времени, измерили речь и сравнили её с другими показателями.
Из этого нельзя сделать вывод:
— У человека речевой возраст на семь лет выше, значит через пять лет у него разовьётся деменция.
Для такого утверждения нужно годами наблюдать за людьми.
Посмотреть, действительно ли сегодняшнее изменение речи предсказывает будущую болезнь.
Таких данных пока нет.
Поэтому speech clock сегодня — исследовательский биомаркер, а не домашний диагноз по телефону.
И это очень важная разница.
Ещё одна проблема — язык
Все 2928 участников говорили на испанском.
Причём на вариантах испанского пяти разных стран, что для одного исследования уже весьма неплохо.
Но русский — не испанский.
Английский — тоже.
Японский устроен совсем иначе.
Различаются ритм, синтаксис, фонетика, длина слов, интонации и культурные особенности речи.
Модель нельзя просто перевести кнопкой:
Language → Russian.
Её нужно проверять на других языках и популяциях.
И вполне возможно, часть признаков старения окажется универсальной, а часть придётся изучать отдельно для каждой языковой среды.
И даже микрофон способен всё испортить
Исследовательская запись проводится в относительно контролируемых условиях.
А реальная жизнь выглядит иначе.
Один человек записал голос на хороший смартфон дома.
Другой — на дешёвый телефон в автобусе.
У третьего простуда.
Четвёртый не выспался.
Пятый выпил.
Шестой только что сорок минут кричал на футбольном матче.
Если инструмент когда-нибудь станет массовым, ему придётся научиться отличать:
«ваша речь изменилась из-за старения мозга»
от:
«вы сегодня просто охрипли».
Для медицины разница слегка существенная.
Зато у голоса есть огромное преимущество
Он практически бесплатный.
МРТ требует дорогого аппарата.
Специалиста.
Клиники.
Записи.
Анализы крови требуют лаборатории.
Забора материала.
Расходников.
Логистики.
Для записи речи нужен микрофон, который уже лежит в кармане у нескольких миллиардов человек.
Четыре минуты разговора можно получить дома.
Через интернет.
В деревне.
В небольшом городе.
В стране, где один томограф обслуживает огромную территорию.
Именно поэтому авторы особенно подчёркивают потенциал такого подхода для регионов с ограниченным доступом к сложной медицинской инфраструктуре.
Скорее всего, главная сила будет не в разовом тесте
Представим, что телефон сегодня оценил ваш речевой возраст как 52 года.
Вам 50.
Ну и что?
Два года разницы могут находиться внутри нормального разброса.
Гораздо интереснее другая схема.
Телефон слышит вас годами.
Не обязательно подслушивает всё подряд — можно раз в месяц проходить короткий стандартизированный тест.
50 лет — речевой возраст 49.
51 год — 50.
52 — 51.
53 — внезапно 58.
Вот изменение траектории уже значительно интереснее одной цифры.
Медицина вообще постепенно двигается именно в эту сторону.
Не сравнивать человека исключительно со средней нормой.
Сравнивать его ещё и с самим собой год назад.
Часы старения сейчас появляются буквально повсюду
У нас уже есть эпигенетический возраст.
Возраст мозга по МРТ.
Сосудистый возраст.
Возраст сетчатки глаза.
Возраст органов по белкам крови.
Возраст иммунной системы.
Теперь появился речевой.
На первый взгляд кажется, что учёные просто нашли новый способ сообщить человеку, что он стареет.
Спасибо, очень полезно.
Но смысл не в самой цифре.
Нас интересует расхождение между разными системами.
Два человека родились в один день.
Одному пятьдесят.
Второму пятьдесят.
Но первый биологически выглядит моложе, второй — старше.
Почему?
Генетика.
Образ жизни.
Болезни.
Стресс.
Среда.
Социальные условия.
Именно эту неодинаковую скорость старения часы и пытаются поймать.
И здесь голос рассказал ещё одну неожиданную историю
Исследователи сравнили speech age gap не только с медицинскими показателями.
Они использовали данные о так называемом социальном экспозоме — накопленном воздействии социальных условий на протяжении жизни.
Образование.
Материальное положение.
Доступ к медицинской помощи.
Пищевая безопасность.
Условия детства.
Различные социальные трудности и неравенство.
И у части групп снова обнаружилась связь.
Чем тяжелее накопленный социальный багаж, тем сильнее речь могла выглядеть для модели «постаревшей».
Это довольно сильная идея.
Мы привыкли считать голос чем-то вроде характеристики гортани.
Низкий.
Высокий.
Хриплый.
Приятный.
Но речь создаёт не только гортань.
Её создаёт вся жизнь человека.
Собственно, мы и сами это иногда слышим
С двумя незнакомыми людьми одинакового паспортного возраста можно поговорить пять минут — и получить совершенно разное впечатление.
Один кажется энергичным, быстрым, легко формулирует мысли, шутит, мгновенно реагирует.
Другой говорит медленнее, долго ищет слова, чаще теряет нить.
Мы можем интуитивно сказать:
— Он выглядит старше своего возраста.
Причём иногда имеем в виду вообще не лицо.
Мы считываем поведение.
Речь.
Движения.
Реакцию.
Но человеческое впечатление чрезвычайно субъективно.
Алгоритм способен превратить часть такого ощущения в сотни измеряемых параметров.
И проверить их на тысячах людей.
Это вообще одна из суперспособностей современного ИИ
Машина начинает извлекать полезный сигнал из данных, которые раньше считались слишком шумными или субъективными.
Сетчатка глаза может рассказать о состоянии сосудов.
Манера печатать — о моторике.
Походка — о неврологических изменениях.
Ночные движения часов — о сне.
Голос — о состоянии мозга.
Каждый отдельный сигнал слабый.
Но у нейросети есть неприятная для человека способность одновременно видеть сотни слабых закономерностей.
Мы ищем один сильный признак.
Она может сложить семьсот почти незаметных.
И это сильно меняет саму идею медицинского обследования
Классическая медицина работает в основном эпизодами.
Что-то заболело.
Человек пришёл в клинику.
Сдал анализ.
Сделал обследование.
Получили снимок состояния организма в одной точке времени.
Цифровые биомаркеры потенциально работают иначе.
Часы знают вашу активность каждый день.
Телефон слышит речь.
Клавиатура видит скорость набора.
Наушники могут измерять физиологические параметры.
Получается непрерывный поток очень дешёвых наблюдений.
Он хуже специализированного медицинского измерения в каждый отдельный момент.
Зато его невероятно много.
И иногда количество начинает компенсировать точность.
Представьте ежегодную диспансеризацию наоборот
Сейчас схема такая:
— Вам пятьдесят. Приходите через год.
Через год человек пришёл.
Между этими двумя точками у врача почти пустота.
Будущая система могла бы заметить:
за последние четыре месяца немного изменилась речь;
одновременно ухудшился сон;
походка стала медленнее;
возрос пульс в покое;
изменилась мелкая моторика.
Ни один показатель отдельно не выглядит тревожно.
Но комбинация отличается от личной нормы человека достаточно сильно, чтобы сказать:
— Может быть, стоит нормально обследоваться.
Не поставить диагноз.
Позвать врача раньше.
И вот здесь дешёвые AI-биомаркеры действительно способны оказаться очень полезными.
Хотя здесь же появляется огромная проблема приватности
Представим другой сценарий.
Страховая компания говорит:
— Запишите нам две минуты речи для подтверждения личности.
А потом её алгоритм обнаруживает:
— Интересно. Речевой возраст у клиента значительно выше паспортного.
Работодатель проводит видеособеседование.
Банк принимает голосовой звонок.
Рекламная платформа анализирует ролик.
Технически одни и те же данные начинают рассказывать о человеке больше, чем он намеревался сообщать.
Голос ведь невозможно нормально оставить дома.
Им мы общаемся.
Созваниваемся.
Записываем видео.
Отправляем сообщения.
Когда биометрические данные начинают превращаться ещё и в косвенные медицинские показатели, вопрос:
кто имеет право их анализировать?
становится намного интереснее.
Потому что человек может даже не знать, что прошёл медицинский анализ
С обычным МРТ всё понятно.
Вы легли в огромную трубу.
Сложно не заметить.
Сдали кровь — тоже довольно очевидно.
А с цифровым биомаркером граница размывается.
Вы просто поговорили с голосовым помощником.
Но технически запись уже содержит десятки признаков, связанных с возрастом, эмоциональным состоянием, акцентом, возможными заболеваниями и социальным происхождением.
ИИ способен вытащить оттуда информацию, которую собеседник вообще не собирался отдавать.
Появляется новый класс персональных данных:
скрытые признаки, вычисленные из обычного поведения.
И законодательство пока явно не успевает за этой идеей.
С другой стороны, это может сильно удешевить ранний скрининг
Деменция — особенно хороший пример.
Заболевание развивается не за один день.
Изменения могут начинаться задолго до момента, когда человек и родственники понимают, что происходит что-то серьёзное.
Но гонять всех людей после пятидесяти на регулярные ПЭТ-сканы или дорогое МРТ невозможно.
Слишком дорого.
Слишком сложно.
А короткий голосовой тест стоит почти ничего.
Если в будущем он сможет надёжно отбирать небольшую группу людей с повышенным риском для нормального медицинского обследования, экономика диагностики сильно меняется.
Не обследовать дорогим методом миллион человек.
Сначала дешёво найти сто тысяч, которым действительно стоит проверить состояние подробнее.
Именно поэтому важно не путать скрининг с диагнозом
Хороший скрининговый инструмент может ошибаться.
Его задача — не вынести окончательный приговор.
Его задача:
не пропустить тех, кого стоит проверить дальше.
Маммография не означает автоматически рак.
Повышенный PSA не означает автоматически рак простаты.
И «старый» голос в будущем не должен означать:
— Поздравляем, у вас деменция.
Он может означать только:
— Ваш профиль изменился сильнее ожидаемого. Давайте посмотрим внимательнее.
Если speech clock когда-нибудь дойдёт до клиники, именно такое применение выглядит значительно реалистичнее магического диагноза через микрофон.
Причём сама речь может рассказать, какой процесс идёт не так
В исследовании участвовали люди с разными заболеваниями.
Болезнь Альцгеймера.
Лобно-височная деменция с преимущественно языковыми проявлениями.
Другие варианты FTD.
И речевой возраст различался между группами.
Особенно выраженный разрыв оказался у людей с языково-доминантной лобно-височной деменцией, что в целом неудивительно: заболевание непосредственно затрагивает системы, участвующие в языке и речи.
В дальнейшем модели, вероятно, будут смотреть уже не только на одну цифру возраста.
Они смогут строить профиль нарушений.
Здесь изменилась семантика.
Здесь моторная часть речи.
Здесь эмоции.
Здесь паузы.
И комбинации таких отклонений могут указывать на совершенно разные процессы.
А дальше можно представить персональные голосовые часы
Сегодня модель обучали на большой популяции.
Но самая интересная версия — вероятно, персональная.
ИИ несколько лет знает вашу нормальную речь.
Не содержание разговоров — для такого мониторинга оно вообще может не понадобиться хранить целиком.
Достаточно параметров.
Средняя скорость.
Типичные паузы.
Диапазон интонаций.
Лексическая сложность.
Ритм.
И затем система ловит не отличие от условного среднего шестидесятилетнего человека.
Она замечает:
вы начали звучать иначе, чем обычно звучите вы.
Такой подход потенциально гораздо чувствительнее.
И заодно немного пугает.
В какой-то момент телефон будет знать, что мы стареем, раньше нас
Не обязательно именно по голосу.
Вместе.
Речь.
Сон.
Движение.
Зрение.
Пульс.
История действий.
Мелкая моторика.
ИИ хорош именно тем, что способен объединить слабые сигналы.
И через десять лет фраза:
— Ваши показатели постепенно отклоняются от вашей индивидуальной нормы,
может стать настолько же обычной, как сегодняшнее уведомление часов:
— Сегодня вы спали на 47 минут меньше среднего.
Только ставки будут немного выше.
И вот здесь особенно хорошо видно, чем настоящий ИИ отличается от чат-бота
Мы слишком привыкли оценивать нейросети по разговору.
Написала статью.
Нарисовала кота.
Ответила на вопрос.
Но огромный пласт применения ИИ вообще не разговаривает с человеком.
Он ищет структуру там, где мы её плохо видим.
Сотни особенностей голоса.
Миллионы снимков.
Слабые изменения в анализах.
Поведение оборудования.
Данные датчиков.
В GPT-Лаборатории я поэтому всё чаще смотрю не на очередной красивый чат-интерфейс, а именно на такие применения. Там ИИ перестаёт быть «умным собеседником» и становится прибором, который способен заметить скрытый сигнал в обычных данных.
По-моему, именно здесь находится значительная часть настоящей AI-революции.
Не в том, что машина научилась красиво отвечать.
А в том, что она начала видеть то, чего человек вообще не замечал.
Правда, иногда лучше, чтобы она этого не видела без разрешения
Потому что технология одинаково прекрасно работает в обе стороны.
Врач получил дополнительный дешёвый биомаркер — замечательно.
Страховая тайно оценивает здоровье клиента по телефону — уже значительно менее замечательно.
Работодатель фильтрует кандидатов по косвенным признакам возраста или состояния здоровья — совсем плохо.
Умная колонка начинает рекламировать таблетки после изменения вашей речи — добро пожаловать в прекрасное цифровое будущее.
Поэтому подобные технологии требуют не только доказательства точности.
Нужны ещё правила.
Что можно вычислять.
Кому.
При каком согласии.
Где хранить результат.
И имеет ли человек право вообще не знать некоторые прогнозы о собственном здоровье.
Медицина сталкивается с этими вопросами давно.
ИИ просто резко снижает стоимость получения информации.
Причём пока мы не знаем даже главного — что именно означает «старый голос»
Допустим, speech clock дал человеку +10 лет.
Почему?
Нейродегенерация?
Сосудистое состояние?
Хронический стресс?
Депрессия?
Социальная нагрузка?
Проблемы с дыханием?
Лекарства?
Общая физическая слабость?
Какая-то комбинация всего перечисленного?
Модель способна увидеть корреляцию раньше, чем наука полностью понимает механизм.
Это одновременно сила и слабость машинного обучения.
Прогноз может работать.
Объяснение отстаёт.
А медицина всё-таки любит причинность
Если врач собирается принимать решение, ему желательно понимать, почему показатель изменился.
Поэтому исследователям придётся разбирать speech clock почти по винтикам.
Какие характеристики оказываются наиболее важными?
Меняются ли они одинаково при нормальном старении и болезни?
Можно ли отделить возраст мозга от состояния голосовых связок?
Какие факторы обратимы?
Влияет ли лечение?
Возвращается ли речевой возраст назад после улучшения состояния?
Вот тогда одна интересная научная работа начнёт превращаться в настоящий клинический инструмент.
Но сам принцип уже впечатляет
Почти три тысячи человек.
Пять стран.
Несколько совершенно разных способов измерения старения.
И простой человеческий голос каким-то образом оказывается связан сразу с несколькими из них.
МРТ смотрит на мозг.
Эпигенетические часы — на ДНК.
Анализ крови — на патологический белок.
Когнитивные тесты — на работу мышления.
Социальный экспозом — на накопленную историю жизни.
А речь сидит где-то посередине и впитывает понемногу от всего.
Потому что говорит всё-таки не гортань.
Говорит человек целиком.
И, возможно, поэтому голос окажется одним из лучших цифровых биомаркеров
Он дешёвый.
Естественный.
Его легко получить.
Можно повторять хоть каждую неделю.
Не нужно носить дополнительный датчик.
Не нужно прокалывать кожу.
Не нужно ехать в больницу.
А внутри записи находится огромное количество информации.
Пока исследователи показали только один способ её использовать.
Вероятно, далеко не последний.
Сегодня ИИ слушает несколько минут и оценивает возраст речи.
Завтра подобная система сможет отслеживать её изменение годами.
И однажды обычное:
— Расскажите, как прошёл ваш день,
может стать частью медицинского обследования.
Человек поговорил с телефоном.
Телефон ничего не диагностировал.
Но заметил, что голос за последний год изменился чуть быстрее, чем должен.
И сказал:
— Возможно, стоит показаться врачу.
Не особенно эффектная технология.
Никакого робота.
Никакой гигантской нейросети на экране.
Просто голос.
Несколько минут.
И алгоритм, который услышал в нём то, что мы сами пока слышим только смутно.
Возможно, именно поэтому эта работа настолько интересна.
Мы всегда знали, что возраст меняет голос.
Теперь выясняется, что голос может рассказать, как именно возраст меняет нас.