Логотип
Достойный человек не идет по следам других людей (Конфуций).

Практическое руководство по новой функции голосового ввода с помощью искусственного интеллекта в Ubuntu

Практическое руководство по новой функции голосового ввода с помощью искусственного интеллекта в Ubuntu

Голосовой ввод на основе искусственного интеллекта появится в Ubuntu в виде Myna — функции преобразования речи в текст, которая позволяет говорить в любое текстовое поле. Работа над ней еще не закончена, но я взял одну из ранних сборок, чтобы посмотреть, как она продвигается.

 

Поскольку Ubuntu 26.10 находится на стадии заморозки, пользовательские компоненты myna постепенно обретают форму. На этой неделе в стандартную установку было добавлено новое расширение GNOME Shell, которое отображает на экране индикатор, когда myna слушает и записывает.

Для ясности: Myna — это не расширение GNOME Shell. Это оркестратор, который управляет загрузкой модели искусственного интеллекта, активацией с помощью горячих клавиш, передачей аудио с микрофона в модель для расшифровки, а затем выводом результатов в текстовое поле с помощью IBus1.

Но расширение важно. Именно его вы увидите, когда Myna будет активно прослушивать и обрабатывать аудио (и если что-то пойдет не так).

Страница Myna на GitHub гласит: «Независимо от того, хотите ли вы диктовать текст без помощи рук, повысить доступность системы или оптимизировать рабочий процесс, myna обеспечивает удобное распознавание голоса прямо в вашей экосистеме Linux».

В той версии, которую я опробовал, я активировал Myna, нажав (но НЕ удерживая — это изменение по сравнению с тем, как Canonical описывала эту функцию ранее) super + t, предварительно выделив текстовое поле в приложении, в котором я хочу использовать голосовой ввод.

Появляется экранное меню, указывающее на то, что прослушивание активно. Пока я говорил, внутри экранного меню колеблется анимированная ‘волна’.Это приятный подтверждающий отзыв, чтобы вы знали, что это работает.

Читать  Motorola Razr 2022 наконец-то доступен для остального мира

По завершении повторное нажатие той же комбинации клавиш прекращает прослушивание. Анимация экранного меню становится плоской, поскольку звук записывается в фоновом режиме. После короткой паузы текст появился в текстовом поле нужного мне приложения.

Расширение Myna для GNOME Shell сообщает, работает ли оно

 

Согласно спецификации, если после активации Myna закрыть или свернуть «целевое» окно, оно перестанет работать. У меня не получалось добиться, чтобы это происходило стабильно, хотя всплывающее окно Myna иногда сообщало о потере фокуса.

Согласно спецификации, переключение фокуса на другое окно или переключение с помощью Alt+Tab не прерывает ввод. Myna отслеживает целевую область, а значит, вы не вставите нужный текст в неправильное текстовое поле!

Если Myna не слышит звук, она сообщает вам об этом; она не может расшифровать тишину или, увы, работать телепатически.

 

Myna будет использовать различные модели искусственного интеллекта

По словам представителей Canonical, звук не покидает ваше устройство. Myna не полагается на облачные модели; она работает полностью автономно, в прямом и переносном смысле. И любой звук, который используется для расшифровки, не сохраняется, не регистрируется и не используется для обучения.

В ходе тестирования Myna использовала Whisper. Но будут доступны различные локальные модели ИИ (все в виде snap-пакетов), в том числе те, которые могут работать только на графических процессорах NVIDIA, только на центральном процессоре, с более широкой языковой поддержкой и т. д.

К тому времени, когда эта функция будет готова к более широкому тестированию, будет использоваться лучшая локальная модель ИИ для вашего оборудования.

Мы пока не нашли ни голосовых снимков, ни myna orchestrator в магазине Snap, но мне удалось запустить их из исходного кода на GitHub. Поскольку эта функция будет распространяться как snap

Читать  Сгенерировать случайное число в bash

Хорошая новость в том, что она работает довольно точно, хотя и немного медленно (я запускал незавершенный исходный код на виртуальной машине, так что не стоит воспринимать это как должное). Ввод данных происходил в большинстве полей, которые мы пробовали, включая текстовый редактор, обзор GNOME Shell и Firefox.

 

Диктовка для Ubuntu, а не Ubuntu для диктовки

По словам вице-президента Canonical по инжинирингу Джона Сигера, компания будет придерживаться осознанного подхода к функциям искусственного интеллекта в Ubuntu. Он сказал, что использование ИИ ради самого ИИ редко приносит пользу и что любые функции в Ubuntu должны быть действительно полезны для пользователей.

Не фанат искусственного интеллекта? Ожидается, что Myna будет доступна по подписке. И она, и модели распознавания речи, которые загружаются по запросу, будут представлять собой Snap-пакеты, которые можно легко удалить (и избежать их использования).

  1. В будущих релизах планируется реализовать метод inout на основе Wayland.
  2. Если вы играете в бинго с использованием искусственного интеллекта, поздравляем, вы выиграли! Для полного понимания потребовались бы конструкции «с легкостью», «возвысить» и «это не Х, это Y». ↩︎
  3. В репозитории Myna есть вложенные папки с перекрестными ссылками .md на файлы, структура и формулировки которых однозначно направляют агентов ИИ и помогают им понимать/устанавливать ограничения. Однако неясно, был ли какой-либо из кодов Myna сгенерирован инструментами ИИ.

Если вы нашли ошибку, пожалуйста, выделите фрагмент текста и нажмите Ctrl+Enter.

Редактор: AndreyEx

Рейтинг: 5 (1 голос)
Если статья понравилась, то поделитесь ей в социальных сетях:

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

18 − 2 =

Это может быть вам интересно


Спасибо!

Теперь редакторы в курсе.

Прокрутить страницу до начала