Перейти к основному содержимому

Голосовой ввод для Deep Code: говорите то, что думаете. ИИ разберётся остальное.

ИИ значительно повысил нашу продуктивность, но ввод текста по-прежнему остаётся узким местом. Голосовые инструменты диктовки вроде Siri или Google Dictation хорошо справляются с отправкой текстовых сообщений, но у них есть фундаментальный недостаток: они ничего не знают о вашем проекте. Они распознают слова — но не понимают намерений.

Вам не нужно, чтобы компьютер записывал то, что вы сказали. Вам нужно, чтобы он понял, что вы хотите сделать.

Deep Code решает эту проблему, встраивая голосовой ввод непосредственно в интерфейс с полным учётом контекста вашего проекта.

Почему универсальные голосовые инструменты не справляются

Они распознают. Но не понимают.

Потребительские голосовые инструменты созданы для повседневного общения — переписки, быстрых заметок, поисковых запросов. Их задача — дословная транскрипция, слово за словом.

Управление ИИ с помощью голоса — это совершенно другая задача. Вы не диктуете сообщение — вы даёте инструкции. И это различие имеет значение:

  • Диктовка: «Напомни мне купить молоко» → транскрибируется как «Напомни мне купить молоко»
  • Управление ИИ: «Измени порт в том конфигурационном файле, который я редактировал вчера, на 8080» — ИИ должен знать, какой конфигурационный файл, какое поле и какое значение — и ни одна из этих деталей не содержится в самих словах.

Универсальный инструмент точно записывает каждое слово. Он не может определить, на что эти слова на самом деле указывают.

Ваше мышление нелинейно. А их транскрипция — линейна.

Вы мыслите ассоциативно. Вы меняете мнение посередине предложения. Вы возвращаетесь к предыдущим идеям. Это нормально.

Инструменты голосовой диктовки используют потоковую транскрипцию — текст появляется в реальном времени по мере речи. Для общения это подходит. Для технических инструкций это создаёт проблемы:

  • Передумали на середине? Первая часть засоряет итоговый промпт.
  • Свободно ассоциируете идеи? Они попадают в хронологическом порядке, а не в логическом.
  • Пауза для размышления? Инструмент не отличает паузу от конца фразы.

Ваше сознание работает как ментальная карта. Линейная транскрипция — это прямая линия, и многое теряется между точками.

Голосовой ввод Deep Code: создан для управления ИИ

Голосовой ввод, понимающий контекст. Говорите естественно на любом языке, свободно смешивайте термины — всё будет упорядочено. Оговорились? Не проблема — контекстная коррекция справится автоматически.

Транскрипция с учётом контекста

Ваша речь сначала транскрибируется, а затем дополнительно обрабатывается ИИ с использованием текущего контекста разговора и структуры файлов вашего проекта.

На практике это означает:

  • Имена файлов, пути к каталогам и имена переменных, которые вы упоминаете, сопоставляются с их реальными аналогами в проекте.
  • Сказанное и сразу исправленное вами отфильтровывается — не транскрибируется.
  • Разрозненные, нелинейные мысли реорганизуются по важности и логическому порядку.

Пример: вы работаете с config/app.yaml и хотите изменить порт на 8080. Вы говорите:

«Измени порт в том конфигурационном файле — в приложенном, тот, над которым ты работал раньше — на 8080. Кажется, я уже менял его, но изменение не применилось...»

Стандартный инструмент диктовки транскрибирует этот бессвязный текст дословно. Deep Code выдаст:

«Измените поле port в config/app.yaml на 8080.»

Говорите свободно. Запинки — не проблема.

В этом весь смысл.

Стандартная диктовка наказывает за небрежную речь — каждое слово записывается, и ошибка означает начать заново. Модуль голосового ввода переворачивает это допущение. Говорите как хотите. Система наведёт порядок.

Автоматически обрабатываются:

  • Поправки на середине предложения: предыдущая, опровергнутая информация отбрасывается.
  • Размытые ссылки: «тот файл», «вчерашний», «то, о чём мы только что говорили» — разрешаются из контекста.
  • Повторы: дублирующиеся идеи дедуплицируются.
  • Слова-паразиты: э-э, ну, как бы, знаете — удаляются.

Передайте суть. Система сделает остальное.

Смешение языков и терминологии

Разработчики постоянно вплетают технические термины в повседневную речь — имена файлов, функций, фреймворков, CLI-команды. Универсальные голосовые инструменты notoriously плохо справляются с этим, часто превращая useSnippets.ts в бессмыслицу или разбивая npm install на случайные слова.

Модуль голосового ввода оптимизирован для программного контекста. Он обращается к файловому дереву вашего проекта, чтобы отличать реальные идентификаторы от шума:

  • Имена файлов вроде useSnippets.ts и src/utils/index.ts сохраняются в неизменном виде.
  • Имена переменных и функций распознаются корректно.
  • Названия фреймворков и инструментов (Java, C++, npm, git) работают без проблем.

Не торопитесь — до 5 минут

Большинство голосовых инструментов ограничивают запись 60 секундами и запускают обратный отсчёт, создавая ощущение спешки.

Deep Code поддерживает непрерывную запись до 5 минут. Размышляйте в удобном темпе. Останавливайтесь, когда нужно. Никакого тикающего таймера.

Как использовать

Модуль голосового ввода находится в правом нижнем углу окна Deep Code. Никаких меню для открытия, никаких панелей для переключения — он всегда на виду.

Шаг 1: начните запись

Наведите курсор на кнопку записи в правом нижнем углу, чтобы увидеть подсказку. Нажмите для начала.

Шаг 2: говорите

Во время записи кнопка отображает живую осциллограмму (Waveform), отражающую уровень звука. Захват идёт в реальном времени.

Во время записи вы можете:

  • Говорить всё, что приходит в голову, в любом порядке.
  • Править себя или игнорировать ошибки — система справится.
  • Делать паузы для размышления — запись продолжается. Продолжайте, когда будете готовы.

Шаг 3: остановите запись

Нажмите ту же кнопку для остановки. Аудио загружается, и начинается транскрипция.

Шаг 4: проверьте и отправьте

После завершения транскрипции вы увидите обработанный текст для проверки. Отсюда вы можете:

  • Убедиться, что обработанный ИИ текст соответствует вашему намерению.
  • При необходимости отредактировать текст напрямую.
  • Вставить ссылки на файлы из панели обозревателя файлов.
  • Вставить шаблоны промптов из панели фрагментов.
  • Нажать отправить, когда всё будет готово.

Всё происходит в одном окне — без переключения контекста.

Сравнение

Универсальные голосовые инструменты (Siri, Google Dictation и т. д.)Голосовой ввод Deep Code
НазначениеПовседневное общение, заметки, поискУправление ИИ — понимает, что вы хотите сделать
ТранскрипцияПотоковая, дословная по мере речиОбработка ИИ с учётом контекста, упорядочивание перед выводом
Стиль мышленияТребует линейной, аккуратной речиСвободный, нелинейный — говорите всё, что приходит в голову
Обработка ошибокНачать зановоАвтоматическая фильтрация и коррекция
Технические терминыЧасто искажает кодовые идентификаторыРаспознаёт файлы проекта, имена функций, CLI-команды
Ограничение по времениОбычно ~60 секундДо 5 минут
Учёт контекста проектаОтсутствуетГлубокая интеграция с панелью обозревателя файлов и панелью фрагментов

Итоги

Модуль голосового ввода — это не инструмент распознавания речи, а мост от мысли к инструкции. Он берёт то, как вы естественно мыслите и говорите, и превращает в то, на что ИИ может действовать.

Запомните главное:

Говорите свободно. Система сделает остальное.