MedASR: Новая модель для точной расшифровки медицинских диктовок
С появлением MedASR, специализированной системы преобразования речи в текст для медицины, процесс расшифровки медицинских диктовок стал более точным. Модель, основанная на архитектуре Conformer, обучена на 5000 часах обезличенной медицинской речи, включая врачебные диктовки и клинические беседы. MedASR имеет 105 миллионов параметров и принимает аудио в формате mono 16 кГц, выдавая текстовые расшифровки без попыток интерпретировать смысл.
Разработчики видят MedASR как основополагающий инструмент для голосовых приложений в здравоохранении, способствующий более точной расшифровке медицинских заключений и бесед между врачом и пациентом. Модель можно дообучать для адаптации к различным акцентам и условиям, а также использовать в связке с генеративными моделями, такими как MedGemma, для создания более сложных текстовых форматов.
В то же время, OpenAI рассматривает возможность интеграции рекламы в ChatGPT, где спонсорский контент может стать частью ответов модели. Это может привести к более персонализированным рекомендациям, основываясь на интересах пользователя. Ожидается, что первые эксперименты с рекламой могут начаться в первой половине 2026 года.