メインコンテンツまでスキップ

Deep Code の音声入力: 思ったことを話せば、あとは AI がまとめる

AI は生産性を劇的に高めたが、ボトルネックはまだタイピングだ。Siri や Google 音声入力などの音声入力ツールは、メッセージの送信には問題ないが、根本的な弱点がある。プロジェクトのことを何も知らない からだ。言葉は書き取るが、意図は理解しない。

コンピュータに話したことを書き取ってほしくない。やりたいことを理解してほしいのだ。

Deep Code は、プロジェクトコンテキストを完全に把握した音声入力をインターフェースに直接組み込むことで、この問題を解決する。

汎用音声ツールが不十分な理由

書き取るが、理解しない。

消費者向け音声ツールは日常会話 -- メッセージ送信、メモ、検索クエリ -- 用に作られている。その仕事は逐語的な書き取りだ。

AI を音声でコントロールするのはまったく別の問題だ。メッセージを口述しているのではない -- 指示を出しているのだ。この違いは重要だ。

  • 口述: "牛乳を買うのをリマインドして" → そのまま "牛乳を買うのをリマインドして" と書き取られる
  • AI コントロール: "昨日編集したあの設定ファイルのポートを8080に変更して" → AI は どの設定ファイルどのフィールドどの値 かを知る必要がある -- どれも言葉の中にはない。

汎用ツールはすべての言葉を忠実に捉えるが、それらの言葉が実際に何を指すかは解決できない。

あなたの脳は非直線的。書き取りは直線的だ。

思考は横道にそれる。文の途中で気が変わる。前のアイデアに戻る。これは普通のことだ。

音声入力ツールは ストリーミング書き取り を使う -- 話すと同時にリアルタイムでテキストが表示される。チャットではそれでいいが、技術的な指示の出し方には問題を生む。

  • 途中で気が変わったら? 前半が最終プロンプトを汚染する。
  • 自由連想したら? 論理順ではなく時系列順で並ぶ。
  • 考えるために間を置いたら? ツールは一時停止と終了の区別がつかない。

頭の中はマインドマップのように動く。直線的な書き取りは一直線だ -- その間で多くのことが失われる。

Deep Code 音声入力: AI コントロールのために設計

コンテキストを理解する音声入力。どの言語でも自然に話し、用語を自由に混ぜれば -- すべてが整理される。言い間違い? 問題なし -- コンテキスト認識の修正が自動で処理する。

コンテキスト認識の書き取り

話した内容が書き取られた後、現在の会話コンテキストプロジェクトのファイル構造 を使って AI が2回目の洗練を行う。

実際の効果:

  • 言及したファイル名、ディレクトリパス、変数名がプロジェクト内の実際の対応物と照合される。
  • 話してすぐに言い直した部分はフィルタリングされ -- 書き取られない。
  • 散らばった非直線的な思考が、重要度と論理順に再構成される。

例: config/app.yaml を扱っていて、ポートを8080に変更したい場合。こう話す。

「あの設定ファイルのポートを -- アプリの方、前やったやつ -- 8080に変えて。前に一度変えたと思うけど効いてなかった気がする...」

標準の入力ツールはこの混沌を逐語的に書き取る。Deep Code はこう出力する。

「config/app.yaml のポートフィールドを8080に変更してください。」

自由に話そう。つまずいても大丈夫。

ここがすべてだ。

標準の音声入力はたどたどしいスピーチを罰する -- すべての言葉が記録されるので、ミスはやり直しを意味する。音声入力モジュールはその前提を逆転させる。どう話してもいい。システムが整えるからだ。

以下を自動で処理する。

  • 文の途中の言い直し: 先の、矛盾した内容は破棄される。
  • 曖昧な参照「あのファイル」「昨日やったやつ」「さっき話したやつ」 -- コンテキストから解決される。
  • 繰り返し: 重複するアイデアは重複排除される。
  • フィラーえー、あの、なんか、みたいな -- 除去される。

要点を伝えればいい。あとはシステムがやる。

コードスイッチングと用語の混在

開発者は技術用語を日常会話に頻繁に混ぜる -- ファイル名、関数名、フレームワーク名、CLI コマンド。汎用音声ツールはこれが壊滅的に苦手で、useSnippets.ts をわけのわからないものに変えたり、npm install をバラバラの単語に分解したりする。

音声入力モジュールはプログラミングコンテキストに最適化されている。プロジェクトのファイルツリーを参照して、何が実際の識別子で何がノイズかを判断する。

  • useSnippets.tssrc/utils/index.ts などのファイル名はそのまま保持される。
  • 変数名と関数名は正しく認識される。
  • フレームワークやツール名(JavaC++npmgit)もそのまま通る。

急がなくていい -- 最大5分間

ほとんどの音声メッセージツールは60秒で制限され、カウントダウンが始まって焦らせる。

Deep Code は最大 5分間 の連続録音に対応している。自分のペースで考えればいい。必要に応じて間を置いてもいい。 ticking する時計はない。

使い方

音声入力モジュールは、Deep Code ウィンドウの 右下隅 にある。開くメニューも、切り替えるパネルもない -- 常にそこに在る。

ステップ1: 録音を開始する

右下隅の録音ボタンにホバーするとツールチップが表示される。クリックで開始。

ステップ2: 話す

録音中、ボタンに音声レベルを反映した ライブ波形 が表示される。リアルタイムでキャプチャされている。

録音中は:

  • 思いつくまま、順不同で話せる。
  • 自己訂正やミスの無視もOK -- システムが処理する。
  • 考えるために間を置いても -- 録音は続く。準備ができたら再開。

ステップ3: 録音を停止する

同じボタンをクリックして停止。音声がアップロードされ、書き取りが開始される。

ステップ4: 確認して送信する

書き取りが完了すると、加工済みのテキストが確認用に表示される。ここで:

  • AI が洗練したテキストが意図と一致しているか確認する。
  • 必要に応じて直接テキストを編集する。
  • ファイルエクスプローラーパネルからファイル参照を挿入する。
  • スニペットパネルからプロンプトテンプレートを挿入する。
  • 問題なければ 送信 をクリックする。

すべてが1つのウィンドウ内で完結する -- コンテキストの切り替えはない。

比較表

汎用音声ツール(Siri、Google 音声入力など)Deep Code 音声入力
目的日常のチャット、メモ、検索AI コントロール -- やりたいことを理解する
書き取りストリーミング、話すと同時に逐語的コンテキスト認識の AI 処理、出力前に整理
思考スタイル直線的で慎重なスピーチが必要自由形式、非直線 -- 思いつくまま話す
ミスの扱いやり直し自動的にフィルタリング・修正
技術用語コード識別子を頻繁に壊すプロジェクトファイル、関数名、CLI コマンドを認識
制限時間通常60秒程度最大5分間
プロジェクト認識なしファイルエクスプローラーとスニペットパネルの深い統合

まとめ

音声入力モジュールは、音声テキスト変換ツールではない -- 思考を指示に変えるブリッジ だ。自然な思考と言葉の出し方を、AI が行動できる形に変換する。

1つ覚えておいてほしい。

自由に話せばいい。あとはシステムがやる。