ChatGPT, Claude, Gemini и DeepSeek: почему я давно перестал искать «лучшую нейросеть»

Ещё год-два назад вопрос «какая нейросеть лучше?» был вполне нормальным.

Сегодня он примерно из той же серии, что «какой инструмент лучше — шуруповёрт, болгарка или мультиметр?».

Смотря что вы собрались делать. Если закручивать саморез мультиметром — проблема, скорее всего, не в производителе мультиметра.

С нейросетями сейчас происходит то же самое. ChatGPT, Claude, Gemini и DeepSeek уже достаточно сильные, чтобы каждая из них временами заставляла сказать: «О, вот это круто». И достаточно разные, чтобы через пять минут на другой задаче хотелось спросить: «Ты сейчас серьёзно?»

Поэтому я давно перестал искать одну волшебную кнопку «сделать хорошо». Я смотрю на модели как на команду специалистов.

И это, на мой взгляд, куда полезнее бесконечных рейтингов.

Почему сравнивать нейросети стало сложнее

Во-первых, они меняются быстрее, чем успевают устаревать статьи про них.

На начало августа OpenAI обновила GPT-5.6 Sol в ChatGPT, отдельно заявив о более стабильной работе с фактами и более сфокусированных ответах. Anthropic летом выпустила Claude Sonnet 5, а затем Claude Opus 5. У Google в Gemini уже работает линейка 3.x, включая 3.5 Flash, а сам сервис всё глубже связывается с экосистемой Google. DeepSeek буквально 13 августа вывела V4 Pro в полноценный релиз, при этом рядом остаётся более лёгкий V4 Flash.

То есть если кто-то в январе написал огромный тест «лучшая нейросеть 2026 года», к августу половина участников этого теста уже либо обновилась, либо переехала на новую модель.

Но есть вещи интереснее номеров версий.

У разных систем всё ещё заметно отличается характер работы.

Не условные 91,3 против 92,7 балла в бенчмарке, а то, что чувствуешь, когда реально даёшь им работу.

ChatGPT: когда нужен универсальный мозг, а не одна узкая суперспособность

Главная сила ChatGPT для меня сегодня не в том, что он обязательно победит каждую другую модель в каждой задаче.

Это уже просто очень универсальная рабочая среда.

Можно начать с идеи, потом разобрать файл, потом что-то посчитать, поискать информацию, поработать с картинкой, вернуться к тексту и продолжить всё внутри одного диалога.

И вот эта связность часто важнее лишних трёх процентов в каком-нибудь тесте.

GPT хорошо чувствует задачу целиком. Особенно когда перед ним не формулировка на три строчки, а длинный контекст: что мы уже сделали, куда идём, какие ограничения приняли и что нельзя сломать.

Это тот случай, когда я скорее дам модели не:

«Напиши рекламный текст».

А:

«Вот продукт, вот исследование конкурентов, вот результаты теста, вот что мы уже пробовали, вот что мне не понравилось. Теперь подумай, что с этим делать».

И здесь универсальность начинает давать результат.

Но есть и обратная сторона. Чем универсальнее система, тем легче начать использовать её вообще для всего.

А потом удивляться, почему для конкретной задачи другая модель оказалась лучше.

Claude: когда текст должен перестать пахнуть нейросетью

С Claude у меня вообще отдельные отношения.

Можно дать модели приличный, логичный, фактически нормальный черновик — а потом попросить не придумать всё заново, а сделать текст живым.

И вот здесь Claude часто очень хорош.

Не в смысле «добавь эмоций!!!», после чего текст превращается в рекламный буклет с пятью восклицательными знаками.

А в более тонких вещах: ритм, естественные переходы, интонация, диалоги, нормальная человеческая фраза.

Особенно это заметно на длинной прозе.

Anthropic сама сейчас делает большой упор на агентность и длительные сложные задачи в Sonnet 5, но для меня ценность Claude всё равно не сводится к агентам.

Я бы описал её проще:

если текст уже знает, что он хочет сказать, Claude очень часто помогает ему нормально это сказать.

Именно поэтому я не очень люблю поручать одной и той же модели сразу всё:

  1. придумай;
  2. напиши;
  3. проверь;
  4. оцени;
  5. скажи, какой ты молодец.

Она, разумеется, почти всегда оказывается довольна собственной работой.

Гораздо интереснее, когда один ИИ пишет, а другой приходит с красной ручкой.

Gemini: сила не только в самой модели

Gemini немного сложнее оценивать по принципу «кто умнее».

Потому что Google играет не только в модель.

Google играет в экосистему.

Gemini умеет работать вместе с сервисами Google, а сама компания всё сильнее превращает его из отдельного чата в помощника, встроенного в привычную инфраструктуру: документы, почту, календарь, поиск, YouTube и другие сервисы.

И вот это потенциально очень серьёзное преимущество.

Представьте две нейросети.

Первая отвечает на вопросы на 5% лучше.

Вторая отвечает чуть хуже, зато уже видит ваши документы, письма, встречи, таблицы и может что-то делать внутри привычной рабочей среды.

Для бизнеса второй вариант внезапно может оказаться намного полезнее.

Потому что пользователю вообще плевать на таблицу бенчмарков.

Ему нужно:

найди письмо от клиента, посмотри договор, сравни его с прошлой версией и напомни мне завтра утром ответить.

Вот когда ИИ начинает жить внутри рабочего процесса, разговор «кто набрал больше баллов» становится немного академическим.

DeepSeek: когда экономика тоже имеет значение

DeepSeek очень хорошо напомнила рынку одну неприятную вещь.

Не всегда побеждает тот, кто показал самый красивый деморолик.

Иногда побеждает тот, кто позволяет сделать миллион операций и не продать для этого почку.

В апреле компания представила V4 Preview с контекстом до 1 млн токенов, а 13 августа V4 Pro вышла в полноценный релиз.

И вот для автоматизации это очень важный класс моделей.

Когда вы вручную задаёте ИИ один вопрос вечером, стоимость одного ответа вас почти не интересует.

Когда система делает:

  • 500 анализов;
  • 200 классификаций;
  • 100 черновиков;
  • 100 проверок структуры;
  • 10 тысяч мелких JSON-операций,

цена внезапно становится архитектурным параметром.

Поэтому DeepSeek я бы вообще оценивал не только в категории «умный или не очень».

А в категории:

какой объём полезной работы я могу на нём построить за разумные деньги.

И это уже совсем другой разговор.

Ошибка — заставлять одну модель делать всё

Вот здесь мы подходим к главному.

Допустим, мне нужно автоматически подготовить хорошую статью.

Самый очевидный путь:

«ChatGPT, напиши мне отличную статью».

Готово.

Технически задача выполнена.

Но если нужен устойчивый результат на потоке, я бы строил совершенно иначе.

Одна модель анализирует тему и строит структуру.

Вторая делает черновик.

Третья редактирует стиль.

Четвёртая независимо проверяет, не написали ли первые три какую-нибудь уверенную ерунду.

Причём совсем не обязательно каждый этап отдавать самой дорогой модели.

Это как нанимать генерального директора, чтобы он каждый день вручную перекладывал цифры из одного Excel в другой.

Он, наверное, справится.

Просто есть небольшие вопросы к организации труда.

А какая тогда лучшая?

Вот теперь можно ответить.

Никакая.

И одновременно — каждая.

Если мне нужен универсальный собеседник, сложный анализ, работа с большим контекстом и связка разных инструментов — я очень внимательно смотрю в сторону ChatGPT.

Если нужен длинный живой текст, редактура, стиль, художественная работа — Claude для меня один из первых кандидатов.

Если задача завязана на экосистему Google и рабочие данные внутри неё — преимущество Gemini может оказаться важнее сухого сравнения интеллекта.

Если нужно много дешёвой массовой работы в автоматизации — DeepSeek становится особенно интересным.

А потом всё это можно соединить.

Самая полезная нейросеть — это вообще не нейросеть

Парадокс, но следующий этап развития ИИ для бизнеса, похоже, будет не про поиск «самой умной модели».

Он будет про архитектуру.

Кто какую работу получает.

Кто кого проверяет.

Что происходит, если модель ошиблась.

Кто имеет доступ к интернету.

Кто имеет доступ к базе.

Какие действия разрешены автоматически.

Где нужно подтверждение человека.

Что произойдёт, если один поставщик API просто ляжет на два часа.

И вот тут начинается настоящее веселье.

Потому что сделать красивый ответ в чате уже умеют почти все.

А сделать систему, которая месяц работает сама и не устраивает пожар каждые три дня, — это совсем другой уровень задачи.

Поэтому вопрос «какая нейросеть лучшая?» я бы в 2026 году переформулировал:

Какая нейросеть лучше именно для этой работы — и кто будет проверять её результат?

Вот этот вопрос уже действительно полезный.