본문으로 건너뛰기

Deep Code 음성 입력: 생각을 말하세요. AI가 나머지를 처리합니다.

AI 덕분에 생산성이 크게 향상되었지만, 타이핑은 여전한 병목입니다. Siri나 Google 음성 입력 같은 음성 받아쓰기 도구는 문자 메시지 보내기에는 충분하지만, 근본적인 한계가 있습니다: 프로젝트에 대해 전혀 알지 못한다는 것입니다. 말은 받아 적지만, 의도는 이해하지 못합니다.

컴퓨터가 한 말을 그대로 적어줄 필요는 없습니다. 무슨 일을 하고 싶은지 이해해 주길 바랍니다.

Deep Code은 프로젝트 컨텍스트를 완전히 인식한 상태로 음성 입력을 인터페이스에 직접 내장하여 이 문제를 해결합니다.

일반 음성 도구가 부족한 이유

받아쓰기만 하지, 이해하지는 못합니다

소비자용 음성 도구는 일상 대화에 최적화되어 있습니다 -- 문자 메시지, 간단한 메모, 검색어 등. 그들의 역할은 말 그대로 한 자도 빠짐없이 기록하는 것입니다.

음성으로 AI를 제어하는 것은 완전히 다른 문제입니다. 메시지를 받아쓰는 게 아니라 지시를 내리는 것입니다. 그 차이가 중요합니다:

  • 받아쓰기: "우유 사는 거 알려줘" → *"우유 사는 거 알려줘"*로 기록됨
  • AI 제어: "어제 수정한 그 설정 파일에서 포트를 8080으로 바꿔줘" → AI는 어떤 설정 파일인지, 어떤 필드인지, 어떤 값인지를 알아야 합니다. 이 정보는 말 속에 없습니다.

일반 도구는 모든 단어를 충실하게 기록합니다. 하지만 그 단어가 실제로 무엇을 가리키는지는 파악하지 못합니다.

사람의 사고는 비선형적입니다. 받아쓰기는 선형적입니다

생각은 옆으로 샐 때가 있습니다. 말하다가 마음을 바꾸기도 하고, 앞서 했던 이야기로 되돌아가기도 합니다. 이건 자연스러운 현상입니다.

음성 받아쓰기 도구는 스트리밍 방식의 전사를 사용합니다. 말하는 대로 실시간으로 텍스트가 나타납니다. 채팅에는 적합하지만, 기술 지시를 전달할 때는 문제가 생깁니다:

  • 말하다 마음을 바꾸면? 앞부분이 최종 프롬프트를 오염시킵니다.
  • 자유롭게 아이디어를 내면? 논리적 순서가 아니라 시간순으로 배치됩니다.
  • 생각하느라 멈추면? 도구는 일시 정지와 종료 지점을 구분하지 못합니다.

사람의 머릿속은 마인드맵처럼 작동합니다. 선형적인 받아쓰기는 직선입니다. 사이에 많은 것이 빠져나갑니다.

Deep Code 음성 입력: AI 제어에 특화된 설계

컨텍스트를 이해하는 음성 입력. 어떤 언어로든 자연스럽게 말하고, 용어를 자유롭게 섞어도 전부 정리됩니다. 잘못 말했어도 괜찮습니다 -- 컨텍스트 인식 수정이 자동으로 처리합니다.

컨텍스트 인식 전사

음성이 전사된 뒤, 현재 대화 컨텍스트프로젝트의 파일 구조를 활용하여 AI가 한 번 더 다듬습니다.

실제로 이렇게 작동합니다:

  • 파일 이름, 디렉토리 경로, 변수명 등을 프로젝트에 실제 존재하는 것과 매칭합니다.
  • 말한 뒤 바로 수정한 내용은 기록되지 않고 자동으로 필터링됩니다.
  • 흩어진 비선형적 사고를 중요도와 논리적 순서에 따라 재구성합니다.

예를 들어 config/app.yaml 파일에서 포트를 8080으로 변경하고 싶다고 합시다. 이렇게 말한다면:

"그 설정 파일에서 포트를 바꿔줘 -- 앱 쪽 거, 전에 작업했던 거 -- 8080으로. 이미 한 번 바꿨던 것 같은데 안 먹혔던 것 같은데..."

일반 받아쓰기 도구는 이 횡설수설을 그대로 기록합니다. Deep Code는 이렇게 변환합니다:

"config/app.yaml 파일의 포트 필드를 8080으로 변경하세요."

편하게 말하세요. 더듬어도 괜찮습니다.

이게 핵심입니다.

일반 받아쓰기는 어눌한 발음을 그대로 기록하기 때문에 실수하면 처음부터 다시 시작해야 합니다. 음성 입력 모듈은 이 가정을 뒤집습니다. 어떻게 말하든 시스템이 정리해 줍니다.

자동으로 처리하는 항목:

  • 말 중간의 수정: 앞에서 말한 뒤 뒤집은 내용은 버려집니다.
  • 모호한 참조: "그 파일," "어제 작업한 거," "아까 얘기한 그거" -- 컨텍스트에서 파악합니다.
  • 반복: 동일한 아이디어의 중복은 제거합니다.
  • 말버릇: 음, 어, 뭐, 그 -- 전부 제거됩니다.

핵심만 전달하세요. 나머지는 시스템이 처리합니다.

코드 스위칭과 혼용 용어

개발자는 기술 용어를 일상 언어에 끊임없이 섞어 씁니다. 파일명, 함수명, 프레임워크명, CLI 명령어 등. 일반 음성 도구는 이런 상황에서 악명 높이 못합니다. useSnippets.ts를 엉망으로 변환하거나, npm install을 엉뚱한 단어로 쪼개버리기 일쑤죠.

음성 입력 모듈은 프로그래밍 맥락에 최적화되어 있습니다. 프로젝트의 파일 트리를 참고하여 실제 식별자와 노이즈를 구분합니다:

  • useSnippets.ts, src/utils/index.ts 같은 파일명은 그대로 보존됩니다.
  • 변수명과 함수명이 올바르게 인식됩니다.
  • 프레임워크 및 도구 이름(Java, C++, npm, git)은 기본적으로 잘 작동합니다.

서두를 필요 없습니다 -- 최대 5분

대부분의 음성 메시지 도구는 60초 제한이 있어서 카운트다운이 시작되면 모든 것이 조급해집니다.

Deep Code는 최대 5분 연속 녹음을 지원합니다. 자신의 속도로 생각하세요. 필요하면 멈추세요. 시간에 쫓기지 않습니다.

사용 방법

음성 입력 모듈은 Deep Code 창의 우측 하단에 항상 자리하고 있습니다. 열어야 할 메뉴도, 토글할 패널도 없습니다.

1단계: 녹음 시작

우측 하단의 녹음 버튼에 마우스를 올리면 툴팁이 표시됩니다. 클릭하면 시작됩니다.

2단계: 말하기

녹음 중에는 버튼에 오디오 레벨을 반영하는 실시간 파형이 표시됩니다. 실시간으로 음성이 캡처되고 있습니다.

녹음 중에는 다음이 가능합니다:

  • 떠오르는 대로, 순서에 상관없이 말할 수 있습니다.
  • 스스로 수정하거나 실수를 무시해도 됩니다. 시스템이 처리합니다.
  • 생각하느라 멈춰도 됩니다. 녹음은 계속됩니다. 준비되면 다시 시작하세요.

3단계: 녹음 중지

같은 버튼을 클릭하면 중지됩니다. 오디오가 업로드되고 전사가 시작됩니다.

4단계: 확인 및 전송

전사가 완료되면 처리된 텍스트가 표시됩니다. 여기서 다음이 가능합니다:

  • AI가 다듬은 텍스트가 의도에 맞는지 확인합니다.
  • 필요하면 텍스트를 직접 편집합니다.
  • 파일 탐색기 패널에서 파일 참조를 삽입합니다.
  • 스니펫 패널에서 프롬프트 템플릿을 삽입합니다.
  • 확인이 끝나면 전송을 클릭합니다.

모든 과정이 하나의 창에서 이루어집니다. 컨텍스트 전환도 없습니다.

비교표

일반 음성 도구 (Siri, Google 받아쓰기 등)Deep Code 음성 입력
용도일상 채팅, 메모, 검색AI 제어 -- 하고자 하는 일을 이해함
전사 방식말하는 대로 단어 단위 스트리밍컨텍스트 인식 AI 처리, 출력 전 정리
사고 방식선형적이고 신중한 말하기 필요자유형식, 비선형 -- 떠오르는 대로 말하기
실수 처리처음부터 다시 시작자동 필터링 및 수정
기술 용어코드 식별자를 자주 망침프로젝트 파일, 함수명, CLI 명령어 인식
시간 제한보통 약 60초최대 5분
프로젝트 인식없음파일 탐색기 및 스니펫 패널과 깊이 연동

요약

음성 입력 모듈은 단순한 음성-텍스트 변환 도구가 아닙니다. 생각-지시 변환기입니다. 자연스럽게 생각하고 말하는 방식을 AI가 실행할 수 있는 형태로 바꿔줍니다.

기억할 점:

편하게 말하세요. 나머지는 시스템이 처리합니다.