Аннотация:
В последние несколько дней всех, должно быть, раздражала новая функция тестирования оттенков серого WeChat. Во-первых, в режиме голосового ввода граница «нажмите и удерживайте, чтобы говорить» внезапно становится толстой и черной из опасения, что вы ее не увидите. Затем в режиме ввода текста поле ввода фактически напоминает вам:
Вы можете нажать и удерживать, чтобы преобразовать текст.


Что это значит?
Раньше для использования функции «Нажмите и удерживайте, чтобы говорить» требовалось переключиться в голосовой режим. Вы отпустили исходный голос, а на другой стороне был слышен ваш чертовски очаровательный пузырьковый голос (если только вы активно не решили преобразовать его в текст).

Но теперь вам просто нужно удерживать поле ввода, чтобы говорить, и голос сразу превратится в текст и будет отправлен, когда вы отпустите его.

На первый взгляд это кажется очень удобным. Вы можете отправить его сразу после того, как произнесете это. Однако первой реакцией многих пользователей сети являются жалобы, ведь слишком легко случайно спровоцировать социальную смерть.

Но плохой рецензент сегодня на это не жалуется.
Заметили, что в этом приложении слишком много мест для голосового ввода?
Вы должны знать, что некоторое время назад WeChat просто разместил кнопку микрофона (+1) в правой части поля ввода, и вы можете преобразовать речь в текст одним щелчком мыши. Кроме того, на этот раз нажмите и удерживайте поле ввода (+1), нажмите и удерживайте, чтобы говорить в голосовом режиме (+1), а также голосовую клавишу метода ввода (+1) и собственную диктовку системы (+1).
Теперь, когда вы открываете WeChat, в нижней половине экрана есть 5 голосовых порталов, ожидающих вашего ответа.

Гиги, ты действительно хочешь послушать сабвуфер мистера Плохого Обзора?
Было бы хорошо, если бы такая ситуация возникала только в WeChat на мобильном телефоне. Проблема в том, что сейчас многие приложения такие, от мобильного телефона до компьютера.
Например, версия WeChat для настольных компьютеров Mac раньше имела такое же приглашение, в котором вам предлагалось нажать и удерживать Fn, чтобы ввести текст голосом.

В поле ввода на рабочем столе Feishu также есть строка «Удерживайте Fn, чтобы говорить», чтобы преобразовать речь в текст.

Братья, вы же ведь не представляете, насколько важна клавиша Fn на Mac, верно? Все ли высокочастотные клавиши способа ввода и функциональной области заняты вашим голосом?
Не волнуйтесь, мы идем именно сюда.
В документе Feishu, если вы откроете сетку в таблице, вы обнаружите, что в правом верхнем углу также есть текст, преобразуемый в речь.

Скажем так: если вы сейчас откроете любое большое заводское приложение, вы увидите кучу микрофонов, машущих вам: Дядя, подойди ко мне...

Давайте будем разумны и сделаем голосовой ввод, никто не возражает, множественный выбор — это всегда хорошо.
Но нынешняя позиция, очевидно, представляет собой нечто большее, чем просто «предоставление вам большего количества возможностей»:
Некоторые используют текст для напоминания, некоторые помещают вход на самое видное место, а некоторые просто делают кнопку очень большой.
Похоже, что крупные производители договорились отдавать приоритет голосовой связи, опасаясь, что мы не будем говорить в приложении.
Увидев это, вам, должно быть, интересно, в чем же магия этого голосового ввода?
Поначалу плохой рецензент подумал, что это довольно просто, легко в использовании и дешево.
Эффективность ввода выше по сравнению с пиньинь, а стоимость невысока.
Согласно ценам на официальном сайте Volcano Engine, потоковое распознавание речи Doubao стоит менее 1 юаня в час. Даже если активный пользователь отправляет 10 минут речи каждый день, это будет стоить всего 60 юаней в год. Это по-прежнему розничная цена, и крупным производителям будет дешевле использовать собственные модели.

Но проблема в следующем:
Голосовой ввод — совсем не новинка. Siri смогла диктовать более десяти лет назад, а голосовой поиск на Amap доступен уже много лет. Почему приоритет голоса сейчас так высок?
Позже я подумал об этом и понял, что ключ может заключаться в методе ввода.
Ранее я писал о методах ввода основных производителей, говоря, что метод ввода подобен охраннику, охраняющему дверь всех приложений. Сначала он знает все ваши потребности, а затем приложение.
Например, если вы задаете вопрос в приложении Doubao, метод ввода WeChat может выдать вам ответ еще до того, как вы нажмете «Отправить».

Аналогично, если вы отправляете сообщение в WeChat и вводите его, используя метод ввода Beanbao, WeChat определенно не захочет видеть эту сцену.
Много лет назад метод ввода Sogou превзошел Baidu.
Все пользователи используют Baidu, а слова-кандидаты, которые появляются при вводе, передаются непосредственно в Sogou для поиска.

Поэтому приложения должны задуматься: есть ли у пользователей способ напрямую взаимодействовать со мной и обойти безопасность метода ввода?
Речь в текст.
Действительно, такая технология существовала много лет назад, но на тот момент стоимость была высокой, а точность низкой.
С развитием крупномасштабных моделей речи за последние два года ее точность и скорость реакции стали практически идеальными.
Можно сказать, что преобразование голоса в текст, поддерживаемое искусственным интеллектом, впервые дает приложению возможность работать самостоятельно, не опасаясь быть перехваченным методом ввода.

Но это всего лишь «защита». Давайте посмотрим немного дальше: крупные производители фактически перешли в наступление, заранее захватив вход к следующему поколению взаимодействий.
Сегодня, если вы нажмете и удержите кнопку, чтобы говорить, приложение поможет вам преобразовать ваши слова в слова; завтра, если вы нажмете и удержите кнопку, чтобы говорить, приложение забронирует для вас рейс напрямую?
Уже есть некоторые приложения на основе искусственного интеллекта, которые могут это сделать, но такие приложения, как WeChat и Feishu, также хотят идти в этом направлении, поэтому они сначала обучают пользователей говорить, а затем обучают пользователей напрямую общаться с агентами для удовлетворения своих потребностей.
В приложениях следующего поколения вам придется открывать рот и говорить → искусственный интеллект будет выполнять всю работу напрямую.
Но этот процесс должен быть постепенным.
Поэтому теперь крупные приложения должны сделать все возможное, чтобы направлять и развивать привычку пользователей говорить в своих собственных приложениях, а затем постепенно интегрировать различные сводные и поисковые функции искусственного интеллекта в голосовые команды.
Вот почему все продвигают распознавание голоса.

Но это еще не конец.
В будущем это явление распространится на большинство приложений на рынке.
Потому что в эпоху постепенного роста все соревнуются в том, кто сможет бежать быстрее, а в эпоху акций все соревнуются в том, кто сильнее кусает. Когда торт больше не становится больше, каждая семья может взять только то, что находится в своей миске.
В этой ситуации любая функция, которую можно совместить с ИИ и сделать пользователей зависимыми, пока это делает первая компания, вторая компания последует за ней. Поскольку пользователи зависимы, рыночный спрос изменится, и если вы этого не сделаете, у вас отнимут пользователей.
Не верьте мне, просто покритикуйте себя. Я живой пример успешного обучения в крупной компании.
Когда я впервые увидел эти голосовые записи, я подумал: я печатаю уже более десяти лет, и скорость моей руки не была низкой, так зачем мне разговаривать с телефоном?
Попробовав несколько раз, я обнаружил, что распознавание происходит действительно быстро и точно, а любые неясности можно автоматически исправить.
Несколько месяцев назад я все еще по умолчанию печатал и просто использовал голос, потому что мне было лень это делать...
Что теперь?
Я никогда не печатаю, когда могу открыть рот. Даже когда я сижу в офисе и пишу рукопись, мне хочется диктовать. Мои пальцы больше не болят, а скорость ввода увеличилась. Напротив, когда я время от времени снова переключаюсь на метод ввода, я удивляюсь, почему это так утомительно.

Конечно, моя зависимость от ИИ выходит далеко за рамки этого.
Теперь, когда я вижу длинную статью, у меня нет терпения читать ее от начала до конца, поэтому я просто предоставляю ИИ суммировать ключевые моменты. Если я захочу проверить какие-либо новости или видео в Твиттере, @Grok позволит это сделать; когда я обычно ищу информацию, я просто читаю сводку ИИ, и если это сложно, я позволяю разным агентам разобраться в этом за меня.

Я не обратил особого внимания на эти функции, когда они впервые появились, но, испытав их несколько раз, я не мог жить без них, даже не осознавая этого.
Когда мы с вами оба полагаемся на ИИ, рыночный спрос тонко переписывается.
Не каждый сможет использовать приложение без голоса ИИ и обобщения ИИ. Чтобы адаптироваться к рынку, разработчикам приложений, естественно, придется последовать этому примеру и предоставить эти функции.
Возможно, скоро метод ввода перестанет быть необходимостью.
Когда мы впервые заговорили на эту тему, редакция еще шутила:
Если голосовой ввод продолжится в том же духе, молодые люди в будущем, возможно, даже не смогут печатать пиньинь.
Поначалу это может показаться немного пугающим, но когда придет день, не будет ли иметь значение, если вы не умеете печатать пиньинь? У каждого поколения свои навыки. Предыдущее поколение думало, что мы не умеем ремонтировать лампочки или печатать на пятитактном машинке, но мы все равно жили довольно хорошей жизнью.
Метод ввода никогда не был целью, это всего лишь способ соединить людей и машины. Когда однажды новая дорога станет удобнее, никто не будет скучать по старой дороге.
Колесо времени катится вперед, и всегда есть некоторые навыки, которые постепенно исчезнут с развитием образа жизни общества.
Комментарии