使用 Deep Code 嘅語音輸入:想到咩講咩,好用不止億點點
人工智能極大咁解放咗生產力,但「打字」呢件事本身仍然係一項時間成本。日常有微信語音輸入法、豆包語音輸入法等多種選擇,但佢哋都有一個共同嘅盲區:唔了解使用者目前工作嘅項目上下文,無法做出真正貼合語境嘅轉錄。
而你真正需要嘅,唔係令電腦轉錄你講咗咩——而係讓 AI 明白你想做咩。
Deep Code將語音輸入直接內建入介面,從根本上解決咗呢個問題。
點解普通語音輸入法唔適用
目的唔同
市面上嘅語音輸入法係為日常生活設計嘅工具,面向嘅係聊天、備忘、發訊息等場景。佢嘅任務係忠實咁將你講嘅每一個字轉錄出嚟,越準確越好。
但當你用語音操控 AI 程式設計時,場景完全唔同。你唔係喺「記錄自己講咗咩」,而係喺「讓 AI 明白你想做咩」。呢兩個目標有根本性嘅差異:
- 生活中語音輸入:「我要去嗰間舖頭」→ 轉錄為「我要去嗰間舖頭」
- AI 程式設計語音輸入:「幫我將尋日改嘅嗰個配置文件嘅 port 改成 8080」→ AI 需要知道「尋日改嘅配置文件係邊個」、「port 欄位喺邊度」、「8080 係新值」……
普通輸入法能忠實記錄每一個字,卻無法明白你講嘅內容指向邊度。
方式亦唔同
人類嘅思維方式係發散型跳躍式嘅:想到咩講咩,前後唔一定嚴格按邏輯順序,有時講到一半又推翻前面嘅內容,有時一句話仲未講完就想到另一個補充。
而目前主流嘅語音輸入法都係流式線型轉錄——你一邊講,佢一邊即時輸出文字。呢種方式對聊天冇問題,但對操控 AI 工作流反而帶嚟麻煩:
- 講到一半改變主意,前面講嘅一半內容就會污染最終嘅提示詞;
- 發散嘅想法被忠實咁按順序記錄落嚟,導致轉錄結果混亂、缺乏條理;
- 想到咩講咩嘅節奏被線性嘅轉錄過程打亂。
呢就好似你腦入面係一個思維導圖,但普通輸入法只能輸出線性文本——中間丟失咗大量資訊。
Deep Code 嘅語音輸入模組:專為 AI 控制設計

智能語境理解
語音輸入模組嘅轉錄結果,會經過 AI 智能分析,並結合目前對話上下文同項目檔案資訊進行二次整理。
呢個意思係:
- 你語音中提到嘅檔案名稱、目錄名稱、變數名稱,系統會自動搵到上下文中實際存在嘅對應內容並替換;
- 講到一半被否定嘅內容,系統會自動過濾掉;
- 跳躍嘅發散想法,會被重新按重要程度同內在邏輯關係組織成清晰嘅文字。
舉個例:你喺處理一個叫做 config/app.yaml 嘅配置文件,想將 port 改成 8080。你對住語音輸入講:
「將配置文件嗰個 app 就係你之前搞嘅嗰個檔案,port 改成 8080,之前好似改過一次但係好似冇生效……」
普通輸入法會將呢段話忠實咁轉錄出嚟,而 Deep Code 收到嘅係一個已經被整理過嘅、語義清晰嘅指令:
「將 config/app.yaml 配置文件中嘅 port 欄位修改為 8080。」
想到咩講咩,講錯咗都冇問題
呢個係語音輸入模組嘅核心體驗。
普通輸入法要求你字斟句酌:因為每一個字都會被忠實記錄,講錯咗就要重新嚟。
而語音輸入模組嘅設計哲學正好相反——隨便講,講錯咗都無所謂。系統會自動處理以下情況:
- 講到一半改口:前面講錯嘅內容會被自動丟棄,唔影響最終輸出;
- 用代詞指代:「嗰個檔案」「尋日改嘅」「啱啱嗰個」,系統會根據上下文搵到真實指代;
- 內容重複:講多咗嘅內容會被自動去重;
- 語氣詞過濾:「呃」「嗰個」「嗯」等語氣詞會被自動剔除。
你要做嘅只係將大概意思講出嚟,剩低嘅交畀系統。
中英文混合輸入
開發入面經常會喺中文入面夾帶英文:檔案名稱、目錄名稱、函數名稱、框架術語……呢啲內容喺純中文嘅語境中頻繁出現。
普通語音輸入法喺處理「中文入面夾英文」時往往力不從心,經常將英文詞語識別錯誤,或將一個完整嘅英文術語拆成唔知講咩嘅漢字。
語音輸入模組內建咗針對程式設計語境嘅優化,會根據目前項目嘅檔案結構,自動識別並正確保留英文內容:
- 檔案名稱(如
useSnippets.ts、src/utils/index.ts)唔會被拆碎; - 英文變數名稱、函數名稱會被正確識別;
- 框架術語(如
Java、C++、npm、git等)識別準確。
時間充裕,唔使趕
微信語音最長只能錄 1 分鐘,好多人錄住錄住就開始緊張,時間到咗被迫中斷。
語音輸入模組支援最長 5 分鐘嘅連續錄音。你可以邊諗邊講,節奏完全由你掌控,唔使擔心時間到咗被打斷。
點樣使用
語音輸入模組常駐喺 Deep Code 窗口嘅右下角,唔需要打開任何面板,隨時可用。
第一步:打開錄音
將滑鼠移到窗口右下角嘅錄音按鈕上,會顯示操作提示。點擊按鈕即可開始錄音。
第二步:講嘢
開始講嘢時,錄音按鈕會顯示音量波動動畫,即時展示目前音量大小。你嘅語音正在被即時捕捉。
喺整個錄音過程中,你可以:
- 想到咩講咩,唔使在意順序同邏輯;
- 講錯咗直接糾正或忽略,系統會自動處理;
- 講到一半停低嚟思考,錄音唔會中斷,繼續講就得。
第三步:結束錄音
再次點擊同一個按鈕,結束錄音。系統將音頻內容上傳並開始轉錄處理。
第四步:確認並傳送
轉錄完成後,系統會展示處理後嘅文字內容畀你確認。喺呢個確認介面中,你可以:
- 睇到經過 AI 整理後嘅最終文字,檢查是否準確反映咗你嘅意圖;
- 如有需要,直接喺確認框中修改文字內容;
- 從項目檔案面板插入檔案引用,豐富提示詞內容;
- 從常用提示詞面板插入預置提示詞範本;
- 確認冇問題後,點擊傳送按鈕將內容傳送畀 AI。
整個操作流程唔需要切換窗口,一氣呵成。
同傳統語音輸入法嘅對比
| 微信 / 豆包等通用語音輸入法 | Deep Code 語音輸入模組 | |
|---|---|---|
| 設計目的 | 日常生活(聊天、備忘) | 操控 AI 程式設計,明白你想做咩 |
| 轉錄方式 | 流式線型轉錄,邊講邊出字 | AI 語境理解式轉錄,自動整理後輸出 |
| 思維方式 | 適合線性表達,字斟句酌 | 支援發散跳躍式表達,想到咩講咩 |
| 處理「講錯」 | 講錯只能重新嚟 | 講錯無所謂,自動過濾並修正 |
| 中英文混合 | 英文識別較弱,容易拆碎 | 自動識別程式設計術語,正確保留 |
| 時間限制 | 微信最長 1 分鐘,有時間壓力 | 最長 5 分鐘,充裕從容 |
| 同項目整合 | 唔了解項目上下文 | 深度整合檔案面板同提示詞面板 |
總結
語音輸入模組重新定義咗「語音輸入法」喺 AI 程式設計入面嘅角色——佢唔係將你講嘅嘢變成文字嘅工具,而係將你嘅想法翻譯成 AI 能夠精準理解同執行嘅指令嘅助手。
用好呢個模組,只需要記住一句話:
隨便講,剩低嘅交畀系統。