Deep Code の音声入力: 思ったことを話せば、あとは AI がまとめる
AI は生産性を劇的に高めたが、ボトルネックはまだタイピングだ。Siri や Google 音声入力などの音声入力ツールは、メッセージの送信には問題ないが、根本的な弱点がある。プロジェクトのことを何も知らない からだ。言葉は書き取るが、意図は理解しない。
コンピュータに話したことを書き取ってほしくない。やりたいことを理解してほしいのだ。
Deep Code は、プロジェクトコンテキストを完全に把握した音声入力をインターフェースに直接組み込むことで、この問題を解決する。
汎用音声ツールが不十分な理由
書き取るが、理解しない。
消費者向け音声ツールは日常会話 -- メッセージ送信、メモ、検索クエリ -- 用に作られている。その仕事は逐語的な書き取りだ。
AI を音声でコントロールするのはまったく別の問題だ。メッセージを口述しているのではない -- 指示を出しているのだ。この違いは重要だ。
- 口述: "牛乳を買うのをリマインドして" → そのまま "牛乳を買うのをリマインドして" と書き取られる
- AI コントロール: "昨日編集したあの設定ファイルのポートを8080に変更して" → AI は どの設定ファイル、どのフィールド、どの値 かを知る必要がある -- どれも言葉の中にはない。
汎用ツールはすべての言葉を忠実に捉えるが、それらの言葉が実際に何を指すかは解決できない。
あなたの脳は非直線的。書き取りは直線的だ。
思考は横道にそれる。文の途中で気が変わる。前のアイデアに戻る。これは普通のことだ。
音声入力ツールは ストリーミング書き取り を使う -- 話すと同時にリアルタイムでテキストが表示される。チャットではそれでいいが、技術的な指示の出し方には問題を生む。
- 途中で気が変わったら? 前半が最終プロンプトを汚染する。
- 自由連想したら? 論理順ではなく時系列順で並ぶ。
- 考えるために間を置いたら? ツールは一時停止と終了の区別がつかない。
頭の中はマインドマップのように動く。直線的な書き取りは一直線だ -- その間で多くのことが失われる。
Deep Code 音声入力: AI コントロールのために設計

コンテキスト認識の書き取り
話した内容が書き取られた後、現在の会話コンテキスト と プロジェクトのファイル構造 を使って AI が2回目の洗練を行う。
実際の効果:
- 言及したファイル名、ディレクトリパス、変数名がプロジェクト内の実際の対応物と照合される。
- 話してすぐに言い直した部分はフィルタリングされ -- 書き取られない。
- 散らばった非直線的な思考が、重要度と論理順に再構成される。
例: config/app.yaml を扱っていて、ポートを8080に変更したい場合。こう話す。
「あの設定ファイルのポートを -- アプリの方、前やったやつ -- 8080に変えて。前に一度変えたと思うけど効いてなかった気がする...」
標準の入力ツールはこの混沌を逐語的に書き取る。Deep Code はこう出力する。
「config/app.yaml のポートフィールドを8080に変更してください。」
自由に話そう。つまずいても大丈夫。
ここがすべてだ。
標準の音声入力はたどたどしいスピーチを罰する -- すべての言葉が記録されるので、ミスはやり直しを意味する。音声入力モジュールはその前提を逆転させる。どう話してもいい。システムが整えるからだ。
以下を自動で処理する。
- 文の途中の言い直し: 先の、矛盾した内容は破棄される。
- 曖昧な参照: 「あのファイル」「昨日やったやつ」「さっき話したやつ」 -- コンテキストから解決される。
- 繰り返し: 重複するアイデアは重複排除される。
- フィラー: えー、あの、なんか、みたいな -- 除去される。
要点を伝えればいい。あとはシステムがやる。
コードスイッチングと用語の混在
開発者は技術用語を日常会話に頻繁に混ぜる -- ファイル名、関数名、フレームワーク名、CLI コマンド。汎用音声ツールはこれが壊滅的に苦手で、useSnippets.ts をわけのわからないものに変えたり、npm install をバラバラの単語に分解したりする。
音声入力モジュールはプログラミングコンテキストに最適化されている。プロジェクトのファイルツリーを参照して、何が実際の識別子で何がノイズかを判断する。
useSnippets.tsやsrc/utils/index.tsなどのファイル名はそのまま保持される。- 変数名と関数名は正しく認識される。
- フレームワークやツール名(
Java、C++、npm、git)もそのまま通る。
急がなくていい -- 最大5分間
ほとんどの音声メッセージツールは60秒で制限され、カウントダウンが始まって焦らせる。
Deep Code は最大 5分間 の連続録音に対応している。自分のペースで考えればいい。必要に応じて間を置いてもいい。 ticking する時計はない。
使い方
音声入力モジュールは、Deep Code ウィンドウの 右下隅 にある。開くメニューも、切り替えるパネルもない -- 常にそこに在る。
ステップ1: 録音を開始する
右下隅の録音ボタンにホバーするとツールチップが表示される。クリックで開始。
ステップ2: 話す
録音中、ボタンに音声レベルを反映した ライブ波形 が表示される。リアルタイムでキャプチャされている。
録音中は:
- 思いつくまま、順不同で話せる。
- 自己訂正やミスの無視もOK -- システムが処理する。
- 考えるために間を置いても -- 録音は続く。準備ができたら再開。
ステップ3: 録音を停止する
同じボタンをクリックして停止。音声がアップロードされ、書き取りが開始される。
ステップ4: 確認して送信する
書き取りが完了すると、加工済みのテキストが確認用に表示される。ここで:
- AI が洗練したテキストが意図と一致しているか確認する。
- 必要に応じて直接テキストを編集する。
- ファイルエクスプローラーパネルからファイル参照を挿入する。
- スニペットパネルからプロンプトテンプレートを挿入する。
- 問題なければ 送信 をクリックする。
すべてが1つのウィンドウ内で完結する -- コンテキストの切り替えはない。
比較表
| 汎用音声ツール(Siri、Google 音声入力など) | Deep Code 音声入力 | |
|---|---|---|
| 目的 | 日常のチャット、メモ、検索 | AI コントロール -- やりたいことを理解する |
| 書き取り | ストリーミング、話すと同時に逐語的 | コンテキスト認識の AI 処理、出力前に整理 |
| 思考スタイル | 直線的で慎重なスピーチが必要 | 自由形式、非直線 -- 思いつくまま話す |
| ミスの扱い | やり直し | 自動的にフィルタリング・修正 |
| 技術用語 | コード識別子を頻繁に壊す | プロジェクトファイル、関数名、CLI コマンドを認識 |
| 制限時間 | 通常60秒程度 | 最大5分間 |
| プロジェクト認識 | なし | ファイルエクスプローラーとスニペットパネルの深い統合 |
まとめ
音声入力モジュールは、音声テキスト変換ツールではない -- 思考を指示に変えるブリッジ だ。自然な思考と言葉の出し方を、AI が行動できる形に変換する。
1つ覚えておいてほしい。
自由に話せばいい。あとはシステムがやる。