В недавнем исследовании, опубликованном в журнале Science, специалисты Гарвардской медицинской школы и клиники Beth Israel Deaconess в Бостоне провели сравнительный анализ диагностической точности врачей и передовых языковых моделей OpenAI в условиях приёмного отделения. Эксперимент был направлен на оценку того, насколько эффективно алгоритмы справляются с первичной интерпретацией клинических данных.
Методология исследования
В ходе работы учёные проанализировали 76 реальных случаев пациентов, поступивших в отделение неотложной помощи. Диагнозы, поставленные двумя практикующими терапевтами, сопоставлялись с выводами моделей OpenAI o1 и GPT-4o. Чтобы обеспечить объективность, итоговую оценку точности проводили независимые медицинские эксперты, не имевшие информации о том, кем именно — человеком или машиной — был предложен конкретный вариант диагноза.
Важно подчеркнуть, что нейросети имели доступ лишь к тем же объёмам информации из электронных карт пациентов, которыми располагали врачи в момент первичного триажа.
Результаты: ИИ опережает человека на первом этапе
Результаты оказались примечательными: на этапе первичного приёма, когда клиническая картина ещё не до конца ясна, модель o1 продемонстрировала точность в 67% случаев. В то же время результаты врачей оказались скромнее: один специалист был точен в 55% случаев, другой — в 50%.

Иллюстрация: Nano Banana
Исследователи отмечают, что в сценариях, где наблюдается острый дефицит данных, языковые модели показывают либо сопоставимую с врачебной, либо превосходящую её эффективность.
Ограничения и вопросы безопасности
Несмотря на многообещающие цифры, авторы исследования, в том числе врач Адам Родман, предостерегают от поспешных выводов. ИИ пока не готов к самостоятельной медицинской практике по ряду причин:
- Многомодальность данных: Модели в текущем тесте работали исключительно с текстом. В реальных условиях медицина требует анализа медицинских изображений, результатов лабораторных анализов и проведения полноценного осмотра.
- Вопросы ответственности: На текущий момент юридически не определено, кто должен нести ответственность за медицинские решения, принятые при участии алгоритмов.
- Критика выборки: Ряд экспертов указывает, что сравнение велось с терапевтами, а не с профильными специалистами по неотложной помощи, что могло повлиять на чистоту эксперимента.
Гарвардские учёные настаивают на необходимости проведения широких проспективных клинических испытаний, прежде чем подобные системы можно будет внедрять в повседневную работу медучреждений.






