Google представила новую модель Gemini 3.5 Transcribe, предназначенную для преобразования человеческой речи в текст. Система автоматически распознаёт более 85 языков, умеет работать с различными акцентами и диалектами и даже способна понимать, когда человек переключается с одного языка на другой прямо во время разговора.
Кроме обычной расшифровки, модель пытается привести живую речь в более удобный для чтения вид — например, убрать лишние «э-э», «м-м» и учесть исправления, которые человек делает прямо посреди фразы.
Что умеет Gemini 3.5 Transcribe
Основная задача новой модели — превращать аудио в письменный текст.
Однако Google старается сделать это не как обычную пословную диктовку.
Если человек скажет:
«Давайте встретимся во вторник… нет, лучше в среду»,
система должна понять исправление и записать уже окончательный вариант фразы.
Gemini также может автоматически расставлять знаки препинания и оформлять получившийся текст так, чтобы его было проще читать.
Более 85 языков и разные акценты
Одна из наиболее интересных возможностей — поддержка более 85 языков.
Модель автоматически определяет язык речи и, по заявлению Google, умеет лучше учитывать региональные акценты и диалекты.
Это важно, потому что реальная разговорная речь обычно значительно сложнее учебных аудиозаписей.
Люди говорят быстро, проглатывают отдельные звуки, используют местные варианты произношения и могут переходить с одного языка на другой.
Новая система способна распознавать такое переключение прямо во время разговора.
Можно ли использовать Gemini для изучения иностранного языка
Подобная технология может оказаться полезной и при изучении языков.
Например, учащийся может записать собственную речь на английском, испанском или другом языке, получить текстовую расшифровку и посмотреть, насколько правильно система поняла произнесённые слова.
Это не заменяет проверку произношения преподавателем, но может стать дополнительным способом практики.
Также автоматическая расшифровка пригодится для работы с иностранными подкастами, лекциями, интервью и другими аудиоматериалами.
Полученный текст проще переводить, разбирать по предложениям и использовать для изучения новой лексики.
Gemini умеет различать нескольких собеседников
При работе с заранее записанным аудио система может определять, кто именно говорит.
Сейчас Google заявляет уверенное распознавание до трёх собеседников, а поддержка большего количества участников пока считается экспериментальной.
Каждую реплику можно связать с конкретным говорящим, а отдельные слова — со временем, когда они прозвучали в записи.
Это может пригодиться при расшифровке интервью, разговоров, занятий и небольших встреч.
Что происходит с «э-э» и другими словами-паразитами
Ещё одна необычная особенность Gemini 3.5 Transcribe — автоматическая очистка живой речи.
Обычный человек редко говорит так же гладко, как пишет. Мы делаем паузы, повторяем слова, начинаем предложение заново и используем различные слова-паразиты.
Система способна удалить часть таких элементов и превратить речь в более аккуратный письменный текст.
С одной стороны, это удобно.
С другой — здесь возникает интересный вопрос: где заканчивается обычная расшифровка и начинается редактирование слов человека.
Если нужен абсолютно точный текст разговора, автоматическое «улучшение» речи может оказаться нежелательным. Поэтому результат всё равно стоит проверять.
Может ли ИИ точно понимать иностранную речь
Даже современные системы распознавания речи пока не безошибочны.
Фоновый шум, необычный акцент, редкое слово, имя человека или специальный термин способны привести к неправильной расшифровке.
Для таких случаев Gemini 3.5 Transcribe позволяет задавать собственный список терминов и необычных слов, которые модель должна учитывать.
По данным Google, новая модель стала заметно точнее предыдущих систем компании и быстрее выдаёт окончательный результат.
Но при работе с важной информацией машинную расшифровку по-прежнему лучше воспринимать как инструмент, а не как гарантированно точную запись.
Речь становится новым способом общения с компьютером
Развитие подобных моделей показывает интересную тенденцию.
Ещё недавно голосовой ввод в основном использовался для коротких сообщений или поисковых запросов. Теперь искусственный интеллект постепенно учится понимать обычную человеческую речь со всеми паузами, исправлениями, акцентами и переключениями между языками.
Возможно, со временем привычная клавиатура будет нужна значительно реже.
А для изучающих иностранные языки это означает появление ещё одного инструмента: компьютер всё лучше способен не только переводить текст, но и слышать, что именно и на каком языке говорит человек.
