ИИ-помощники: разбор трех систем по ответам на вопросы пациентов

Но означает другое: ответы на вопросы о применении искусственного интеллекта в медицине нельзя оценивать по гладкости текста, количеству терминов или сочувственному тону.
ChatGPT, Gemini и Claude уже стали интерфейсом первой линии для пациента: «Можно ли совмещать препараты?», «Нормальна ли эта реакция после операции?», «Нужно ли срочно ехать в стационар?». Универсальная языковая модель отвечает быстро, развернуто и почти никогда не молчит. В том же аудите отказ от ответа встретился лишь в 0,8% из 250 запросов. Это плохой показатель не доступности, а самоконтроля системы.
Проблема не в том, что ИИ иногда ошибается. Ошибается и человек. Проблема в механике ошибки: чат-бот способен пропустить один клинически критичный факт, а затем построить вокруг этого пропуска убедительный текст на 300 слов. Пациент получает не диагноз, а имитацию клинической уверенности.
Чем универсальный чат-бот отличается от медицинской системы
ChatGPT, Gemini и Claude — универсальные большие языковые модели, LLM. Они обучены работать с языком: суммировать, объяснять, сопоставлять варианты, поддерживать диалог. Медицина для них — одна из предметных областей, а не единственная рабочая среда.
Специализированные медицинские системы устроены иначе. Их разработчики пытаются ограничить модель клиническими источниками, медицинскими базами знаний, структурированными правилами безопасности и заданными сценариями использования. Это не делает их безошибочными. Но снижает вероятность ответа, который звучит логично и ведет к потенциально тяжелому вреду.
Бенчмарк NOHARM, опубликованный в декабре 2025 года и обновленный в июле 2026-го, зафиксировал разрыв именно здесь. У специализированных решений AMBOSS LiSA, Doximity Ask, OpenEvidence и Glass Health риск тяжелого вреда составил от 2,9% до 5,4%. У универсальных моделей показатели выше: 8,9% у GPT-5.5, 12,8% у Gemini 2.5 Pro, 16,6% у Claude Sonnet 4.6 и 24,6% у Llama 4 Maverick.
Речь не о доле «неприятных» ответов. В бенчмарке оценивали сценарии, где рекомендация способна привести к серьезному ухудшению состояния. Разница между 2,9% и 12,8% в такой задаче не косметическая.
| Параметр | ChatGPT | Gemini | Claude |
|---|---|---|---|
| Основная сильная сторона в исследованиях | Читаемость и структурирование объяснений | Клиническая целесообразность в отдельном сравнении | Более осторожный этический тон |
| Типовой риск | Уверенное упрощение и недостаток safety guidance — инструкций по безопасности | Неравномерное цитирование и зависимость от сценария | Ограниченная языковая ясность |
| Что нельзя поручать без врача | Интерпретацию симптомов, назначения, отмену терапии | Триаж — решение о срочности помощи — как единственный источник | Выбор лечения и оценку противопоказаний |
| Практическая роль для пациента | Подготовить вопросы к приему, расшифровать термины | Сопоставить объяснения и сформировать список уточнений | Получить осторожную формулировку рисков |
Сравнение не дает права объявить победителя. Модель, показавшая лучший результат в вопросах по ортогнатической хирургии, не обязана так же работать в кардиологии, онкологии или лекарственных взаимодействиях. Меняются версия модели, язык запроса, полнота исходных данных, доступ к актуальным источникам и способ оценки.
Медицинский ИИ стоит оценивать не по тому, насколько хорошо он объясняет ответ, а по тому, что он не сказал.
Почему почти половина ответов остаются проблемными
Вопросы пациентов редко бывают клинически полными. Пользователь пишет: «После таблетки кружится голова, это нормально?» Но для безопасного ответа нужны препарат, дозировка, время приема, возраст, сопутствующие болезни, другие лекарства, давление, беременность, характер симптома и его динамика. В реальной консультации врач добирает эти сведения. Чат-бот часто заполняет пробелы статистически вероятным текстом.
Отсюда две группы дефектов.
Первая — factual error, фактическая ошибка. Модель называет неверный срок, путает противопоказание, приписывает препарату эффект, которого нет, или пересказывает устаревшую практику как действующий стандарт.
Вторая — omission error, ошибка упущения. Фраза сама по себе может быть верной, но в ней нет критичного ограничения. Например:
- описаны обычные побочные эффекты, но не перечислены признаки, требующие срочного обращения;
- названа распространенная причина симптома, но не указан опасный альтернативный сценарий;
- дана общая информация о препарате, но не сказано, что корректировать дозировку самостоятельно нельзя;
- объяснена процедура, но пропущены условия, при которых ее не проводят;
- приведен ответ о совместимости средств без данных о дозах, функции почек, печени или сопутствующей терапии.
В NOHARM более 80% тяжелых ошибок всех систем относились именно к упущениям. Это наиболее неудобный тип дефекта для пользователя. Явную нелепость можно заметить. Отсутствующий пункт заметить невозможно, если пациент не знает, что этот пункт должен существовать.
Поэтому запросы вида «использование ИИ в медицине: ответы на вопросы» требуют более трезвой рамки. Чат-бот не проводит осмотр. Не измеряет сатурацию. Не видит ЭКГ, если ее не загрузили. Не проверяет реальную упаковку препарата и не несет клинической ответственности за пропущенный симптом. Его ответ — вторичный текстовый слой над неполными данными.
Отдельная проблема — ссылки. В аудите BMJ Open медианная полнота цитирования составила 40%. То есть даже когда система использовала ссылки или называла источники, читатель получал лишь часть опоры для проверки вывода. Gemini в этом сравнении приводил меньше всего цитат. Наличие библиографии под ответом не заменяет качества самой рекомендации: ссылка может быть нерелевантной, старой или не подтверждать конкретное утверждение.
Кто лучше объясняет пациенту: ChatGPT, Gemini или Claude
В исследовании 2025 года три модели — ChatGPT-4, Gemini 2.5 Pro и Claude Sonnet 4 — отвечали на 20 распространенных вопросов об ортогнатической хирургии. Gemini получил лучшие оценки по Global Quality Score, GQS, клинической целесообразности и эмпатии. Различия были статистически значимыми: p < 0,001.
ChatGPT-4 в этом сравнении оказался наиболее читаемым. Его ответы проще воспринимать, они лучше разбиты на понятные блоки. Но максимальная читаемость не равна максимальной безопасности. Исследователи отмечали недостаток эмпатичного тона и safety guidance — конкретных ориентиров, когда нужно прекратить самостоятельное наблюдение и связаться с врачом.
Claude занял промежуточную позицию: более осторожная этическая интонация, но менее ясная подача. Для пациента это означает знакомую проблему: модель может избегать категоричных назначений, но при этом оставить человека с расплывчатой формулой «обсудите с врачом», не объяснив, какие именно данные следует сообщить и насколько срочна ситуация.
Эмпатия в медицинском интерфейсе не бесполезна. Она влияет на то, дочитает ли пациент ответ, поймет ли термин, решится ли уточнить тревожный симптом. Но эмпатичный язык не является клинической валидацией.
Классическое исследование JAMA Internal Medicine 2023 года показало, что независимые эксперты предпочли ответы ChatGPT ответам врачей с форума Reddit AskDocs в 78,6% случаев. Средняя длина ответа ИИ составила 211 слов против 52 слов у врачей. Этот результат часто используют в рекламе генеративного ИИ. Некорректно.
Форумный ответ врача — не полноценная очная консультация и не клинический протокол. Более длинный, вежливый и структурированный текст закономерно воспринимается лучше короткой реплики. Исследование измеряло качество публичных ответов в конкретном контексте, а не способность ИИ заменить диагностику, осмотр или назначение лечения.
Пациент выбирает понятный ответ. Риск определяется тем, достаточно ли в нем клинических ограничений.
Что меняет формулировка запроса
Один и тот же чат-бот можно заставить выдать опасно общий ответ или относительно полезную памятку. Это не вопрос «правильной магической команды». Это вопрос полноты входных данных и жесткости ограничений.
В исследовании, сравнивавшем ChatGPT 4.0 и Gemini 1.0 Pro при создании обучающих материалов для пациентов, ChatGPT получил 80% по понятности и 60% по применимости по шкале PEMAT-P. У Gemini показатели составили 67% и 60% соответственно. PEMAT-P измеряет не медицинскую истинность текста, а то, насколько материал понятен и позволяет выполнить конкретное действие.
Показателен и уровень чтения. При простом запросе ChatGPT 4.0 писал примерно на уровне 10-го школьного класса, Gemini 1.0 Pro — на уровне 7-го. После детализированного промпта обе системы смогли снизить сложность примерно до уровня 6-го класса. Пользователь получает не фиксированную характеристику модели, а результат взаимодействия между системой и собственным запросом.
Рабочий запрос для образовательной задачи должен содержать четыре элемента:
1. Контекст без домыслов. Возрастная группа, диагноз, название процедуры или препарата, известные данные обследования. Не «плохой анализ крови», а конкретный показатель и единицы измерения.
2. Границы ответа. Запросить объяснение терминов, возможных вопросов к врачу и тревожных признаков. Не требовать «подобрать лечение» или «сказать, нужен ли антибиотик».
3. Уровень языка. Указать: «объясни простыми словами, без медицинского жаргона; каждый термин расшифруй». Это снижает риск получить текст, который кажется понятным только из-за знакомых слов.
4. Проверяемость. Попросить отделить установленные факты от предположений и прямо перечислить недостающие данные. Если модель не указывает, чего ей не хватает, это уже диагностический сигнал о качестве ответа.
Полезная формулировка выглядит так: «Объясни, что означает заключение МРТ простыми словами. Не ставь диагноз и не предлагай лечение. Отдельно перечисли вопросы к неврологу и симптомы, при которых требуется срочная помощь».
Непригодная формулировка: «У меня болит голова, что пить». Во втором случае система будет вынуждена либо отказать, либо имитировать персональную рекомендацию на почти пустом наборе данных. На практике чаще происходит второе.
Для вопросов о выборе клиники, объеме обследований, цифровых сервисах и правах пациента одного ответа чат-бота недостаточно. Разумнее сверять выданную информацию с официальными источниками: сайтами лицензированных клиник, реестрами профильных ведомств, нормативными документами и пояснениями лечащего врача. Чат-бот может составить список вопросов регистратуре или врачу. Решение о процедуре, наличии показаний и допустимости вмешательства он не верифицирует.
Где заканчивается бытовая справка и начинается риск
Применение искусственного интеллекта в здравоохранении имеет приемлемую бытовую зону. В ней модель работает как редактор, переводчик с медицинского на русский и помощник по подготовке к консультации.
Относительно безопасные задачи:
- расшифровать сокращения в выписке без попытки интерпретировать их как диагноз;
- превратить длинное заключение в список вопросов для профильного специалиста;
- объяснить, как обычно готовятся к уже назначенному анализу, с последующей сверкой по инструкции клиники;
- помочь вести структурированный дневник симптомов, давления, глюкозы или побочных реакций;
- перевести медицинский документ, сохранив оригинальные формулировки рядом с упрощенным объяснением;
- сравнить публично заявленные функции телемедицинских сервисов до записи на прием.
Граница проходит там, где нужен clinical judgment — клиническое суждение с учетом контекста пациента. Сюда относятся первичная диагностика, назначение и отмена лекарств, расчет дозировок, интерпретация сочетаний симптомов, решение о срочности госпитализации и выбор инвазивной процедуры.
Особенно уязвимы четыре сценария:
Лекарственные взаимодействия
Чат-бот может помнить распространенное взаимодействие, но не иметь полной информации о дозировках, форме препарата, времени приема и функции органов. Список лекарств из памяти пациента почти всегда неполный: забываются глазные капли, БАДы, обезболивающие «по необходимости», средства от простуды и препараты, назначенные другим врачом.
Симптомы после операции или процедуры
Послеоперационный вопрос нельзя сводить к перечню «нормальных ощущений». Критичны день после вмешательства, вид анестезии, объем операции, температура, характер боли, кровотечение, прием антикоагулянтов и динамика симптомов. Модель, не запросившая эти данные, не имеет основания успокаивать.
Онкология, беременность, детский возраст
Здесь цена ошибки выше, а клинические решения сильнее зависят от индивидуального контекста. Универсальный ИИ допустим только как средство подготовки к разговору с врачом и разбора уже полученной информации.
Психиатрические и кризисные состояния
Алгоритм может распознать отдельные маркеры риска, но не заменяет экстренную помощь и живой контакт. Ответ с общими поддерживающими фразами без понятного маршрута действий — недостаточен.
Как читать ответ ИИ без лишнего доверия
Универсальный чат-бот полезнее воспринимать как младшего редактора без доступа к кабинету врача. Он способен собрать текст, но не обладает правом закрывать клиническую неопределенность.
Признаки ответа, который можно использовать только как черновик для дальнейшей проверки:
- модель уверенно называет диагноз по одному симптому;
- дает дозировку или предлагает заменить препарат без уточняющих вопросов;
- использует слова «точно», «безопасно», «вам не о чем беспокоиться»;
- перечисляет редкие диагнозы без объяснения вероятности и критериев;
- не отделяет общую информацию от персональной рекомендации;
- не указывает красные флаги — симптомы, при которых требуется очная или неотложная помощь;
- ссылается на источники, которые нельзя проверить, либо приводит ссылки, не подтверждающие основной вывод.
Не стоит требовать от модели «ответь как врач». Такая команда не превращает генеративную систему в лицензированного специалиста. Она лишь повышает вероятность уверенного стиля. Для пациента это худший обмен: больше авторитетной интонации, столько же неполных исходных данных.
Вердикт
ChatGPT, Gemini и Claude пригодны для объяснения медицинской информации. Gemini в отдельных исследованиях показывает более высокую клиническую целесообразность и эмпатию. ChatGPT — более читаемую подачу. Claude — более осторожную риторику. Ни один из этих результатов не подтверждает превосходство модели во всех клинических сценариях.
Специализированные медицинские ИИ-системы в тестах безопасности выглядят предпочтительнее универсальных. Но и они не отменяют проверку врачом, особенно если речь идет о назначениях, диагнозе и срочности помощи.
- 49,6% проблемных ответов в аудите — достаточная причина не принимать текст чат-бота за медицинское заключение.
- Главный риск — не грубая ложь, а пропущенное условие, противопоказание или тревожный симптом.
- ИИ стоит использовать для подготовки к приему, структурирования документов и перевода терминов.
- Чем персональнее решение и выше цена ошибки, тем меньше места у универсального чат-бота и тем больше — у профильного врача.