跳至主要内容

使用 Deep Code 嘅語音輸入:想到咩講咩,好用不止億點點

人工智能極大咁解放咗生產力,但「打字」呢件事本身仍然係一項時間成本。日常有微信語音輸入法、豆包語音輸入法等多種選擇,但佢哋都有一個共同嘅盲區:唔了解使用者目前工作嘅項目上下文,無法做出真正貼合語境嘅轉錄

而你真正需要嘅,唔係令電腦轉錄你講咗咩——而係讓 AI 明白你想做咩。

Deep Code將語音輸入直接內建入介面,從根本上解決咗呢個問題。

點解普通語音輸入法唔適用

目的唔同

市面上嘅語音輸入法係為日常生活設計嘅工具,面向嘅係聊天、備忘、發訊息等場景。佢嘅任務係忠實咁將你講嘅每一個字轉錄出嚟,越準確越好。

但當你用語音操控 AI 程式設計時,場景完全唔同。你唔係喺「記錄自己講咗咩」,而係喺「讓 AI 明白你想做咩」。呢兩個目標有根本性嘅差異:

  • 生活中語音輸入:「我要去嗰間舖頭」→ 轉錄為「我要去嗰間舖頭」
  • AI 程式設計語音輸入:「幫我將尋日改嘅嗰個配置文件嘅 port 改成 8080」→ AI 需要知道「尋日改嘅配置文件係邊個」、「port 欄位喺邊度」、「8080 係新值」……

普通輸入法能忠實記錄每一個字,卻無法明白你講嘅內容指向邊度。

方式亦唔同

人類嘅思維方式係發散型跳躍式嘅:想到咩講咩,前後唔一定嚴格按邏輯順序,有時講到一半又推翻前面嘅內容,有時一句話仲未講完就想到另一個補充。

而目前主流嘅語音輸入法都係流式線型轉錄——你一邊講,佢一邊即時輸出文字。呢種方式對聊天冇問題,但對操控 AI 工作流反而帶嚟麻煩:

  • 講到一半改變主意,前面講嘅一半內容就會污染最終嘅提示詞;
  • 發散嘅想法被忠實咁按順序記錄落嚟,導致轉錄結果混亂、缺乏條理;
  • 想到咩講咩嘅節奏被線性嘅轉錄過程打亂。

呢就好似你腦入面係一個思維導圖,但普通輸入法只能輸出線性文本——中間丟失咗大量資訊。

Deep Code 嘅語音輸入模組:專為 AI 控制設計

懂你更懂 AI 嘅語音輸入。中英文隨便講,全部整得明明白白。講錯咗更加無所謂,會根據上下文自動幫你修正。好用不止億點點

智能語境理解

語音輸入模組嘅轉錄結果,會經過 AI 智能分析,並結合目前對話上下文項目檔案資訊進行二次整理。

呢個意思係:

  • 你語音中提到嘅檔案名稱、目錄名稱、變數名稱,系統會自動搵到上下文中實際存在嘅對應內容並替換;
  • 講到一半被否定嘅內容,系統會自動過濾掉;
  • 跳躍嘅發散想法,會被重新按重要程度同內在邏輯關係組織成清晰嘅文字。

舉個例:你喺處理一個叫做 config/app.yaml 嘅配置文件,想將 port 改成 8080。你對住語音輸入講:

「將配置文件嗰個 app 就係你之前搞嘅嗰個檔案,port 改成 8080,之前好似改過一次但係好似冇生效……」

普通輸入法會將呢段話忠實咁轉錄出嚟,而 Deep Code 收到嘅係一個已經被整理過嘅、語義清晰嘅指令:

「將 config/app.yaml 配置文件中嘅 port 欄位修改為 8080。」

想到咩講咩,講錯咗都冇問題

呢個係語音輸入模組嘅核心體驗。

普通輸入法要求你字斟句酌:因為每一個字都會被忠實記錄,講錯咗就要重新嚟。

而語音輸入模組嘅設計哲學正好相反——隨便講,講錯咗都無所謂。系統會自動處理以下情況:

  • 講到一半改口:前面講錯嘅內容會被自動丟棄,唔影響最終輸出;
  • 用代詞指代:「嗰個檔案」「尋日改嘅」「啱啱嗰個」,系統會根據上下文搵到真實指代;
  • 內容重複:講多咗嘅內容會被自動去重;
  • 語氣詞過濾:「呃」「嗰個」「嗯」等語氣詞會被自動剔除。

你要做嘅只係將大概意思講出嚟,剩低嘅交畀系統。

中英文混合輸入

開發入面經常會喺中文入面夾帶英文:檔案名稱、目錄名稱、函數名稱、框架術語……呢啲內容喺純中文嘅語境中頻繁出現。

普通語音輸入法喺處理「中文入面夾英文」時往往力不從心,經常將英文詞語識別錯誤,或將一個完整嘅英文術語拆成唔知講咩嘅漢字。

語音輸入模組內建咗針對程式設計語境嘅優化,會根據目前項目嘅檔案結構,自動識別並正確保留英文內容:

  • 檔案名稱(如 useSnippets.tssrc/utils/index.ts)唔會被拆碎;
  • 英文變數名稱、函數名稱會被正確識別;
  • 框架術語(如 JavaC++npmgit 等)識別準確。

時間充裕,唔使趕

微信語音最長只能錄 1 分鐘,好多人錄住錄住就開始緊張,時間到咗被迫中斷。

語音輸入模組支援最長 5 分鐘嘅連續錄音。你可以邊諗邊講,節奏完全由你掌控,唔使擔心時間到咗被打斷。

點樣使用

語音輸入模組常駐喺 Deep Code 窗口嘅右下角,唔需要打開任何面板,隨時可用。

第一步:打開錄音

將滑鼠移到窗口右下角嘅錄音按鈕上,會顯示操作提示。點擊按鈕即可開始錄音。

第二步:講嘢

開始講嘢時,錄音按鈕會顯示音量波動動畫,即時展示目前音量大小。你嘅語音正在被即時捕捉。

喺整個錄音過程中,你可以:

  • 想到咩講咩,唔使在意順序同邏輯;
  • 講錯咗直接糾正或忽略,系統會自動處理;
  • 講到一半停低嚟思考,錄音唔會中斷,繼續講就得。

第三步:結束錄音

再次點擊同一個按鈕,結束錄音。系統將音頻內容上傳並開始轉錄處理。

第四步:確認並傳送

轉錄完成後,系統會展示處理後嘅文字內容畀你確認。喺呢個確認介面中,你可以:

  • 睇到經過 AI 整理後嘅最終文字,檢查是否準確反映咗你嘅意圖;
  • 如有需要,直接喺確認框中修改文字內容;
  • 項目檔案面板插入檔案引用,豐富提示詞內容;
  • 常用提示詞面板插入預置提示詞範本;
  • 確認冇問題後,點擊傳送按鈕將內容傳送畀 AI。

整個操作流程唔需要切換窗口,一氣呵成。

同傳統語音輸入法嘅對比

微信 / 豆包等通用語音輸入法Deep Code 語音輸入模組
設計目的日常生活(聊天、備忘)操控 AI 程式設計,明白你想做咩
轉錄方式流式線型轉錄,邊講邊出字AI 語境理解式轉錄,自動整理後輸出
思維方式適合線性表達,字斟句酌支援發散跳躍式表達,想到咩講咩
處理「講錯」講錯只能重新嚟講錯無所謂,自動過濾並修正
中英文混合英文識別較弱,容易拆碎自動識別程式設計術語,正確保留
時間限制微信最長 1 分鐘,有時間壓力最長 5 分鐘,充裕從容
同項目整合唔了解項目上下文深度整合檔案面板同提示詞面板

總結

語音輸入模組重新定義咗「語音輸入法」喺 AI 程式設計入面嘅角色——佢唔係將你講嘅嘢變成文字嘅工具,而係將你嘅想法翻譯成 AI 能夠精準理解同執行嘅指令嘅助手。

用好呢個模組,只需要記住一句話:

隨便講,剩低嘅交畀系統。