Przejdź do głównej zawartości

Wprowadzanie głosowe dla Deep Code: powiedz, co myślisz. AI resztę ogarnie.

AI uczyniło nas drastycznie bardziej produktywnymi, ale pisanie wciąż jest wąskim gardłem. Narzędzia do dyktowania głosowego, takie jak Siri czy Google voice typing, dobrze sprawdzają się przy wysyłaniu SMS-ów, ale mają fundamentalną ślepą plamkę: nic nie wiedzą o twoim projekcie. Transkrybują słowa — nie rozumieją intencji.

Nie potrzebujesz, by komputer transkrybował to, co powiedziałeś. Potrzebujesz, by zrozumiał, co chcesz zrobić.

Deep Code rozwiązuje to, wbudowując wprowadzanie głosowe bezpośrednio w interfejs, z pełną świadomością kontekstu twojego projektu.

Dlaczego ogólne narzędzia głosowe nie wystarczają

Transkrybują. Nie rozumieją.

Konsumenckie narzędzia głosowe są stworzone do codziennych rozmów — SMS-ów, notatek, zapytań wyszukiwania. Ich zadaniem jest dosłowna transkrypcja, słowo po słowie.

Sterowanie AI głosem to zupełnie inny problem. Nie dyktujesz wiadomości — wydajesz instrukcje. Różnica ma znaczenie:

  • Dyktowanie: „Przypomnij mi, żebym kupił mleko" → transkrybowane jako „Przypomnij mi, żebym kupił mleko"
  • Sterowanie AI: „Zmień port w tym pliku konfiguracyjnym, który edytowałem wczoraj, na 8080" → AI musi wiedzieć, który plik konfiguracyjny, które pole i jaką wartość — żadna z tych informacji nie jest zawarta w samych słowach.

Ogólne narzędzie wiernie rejestruje każde słowo. Nie potrafi rozwiązać, do czego te słowa się odnoszą.

Twój mózg nie jest liniowy. Ich transkrypcja jest.

Myślisz w skojarzeniach. Zmieniasz zdanie w połowie zdania. Wraca do wcześniejszych myśli. To normalne.

Narzędzia do dyktowania wykorzystują transkrypcję strumieniową — tekst pojawia się w czasie rzeczywistym, gdy mówisz. Do czatu to wystarczy. Do wydawania instrukcji technicznych tworzy problemy:

  • Zmieniasz zdanie w połowie? Wcześniejsza połowa zanieczyszcza końcowy prompt.
  • Łączysz swobodnie pomysły? Lądują w porządku chronologicznym, nie logicznym.
  • Robisz pauzę, by pomyśleć? Narzędzie nie rozróżnia pauzy od zakończenia.

Twój umysł pracuje jak mapa myśli. Liniowa transkrypcja to prosta linia — dużo ginie po drodze.

Wprowadzanie głosowe Deep Code: stworzone do sterowania AI

Wprowadzanie głosowe, które rozumie kontekst. Mów naturalnie w dowolnym języku, mieszaj terminy swobodnie — wszystko zostanie uporządkowane. Pomyliłeś się? Żaden problem — korekta świadoma kontekstu radzi sobie automatycznie.

Transkrypcja świadoma kontekstu

Twoja mowa jest transkrybowana, a następnie doprecyzowywana przez AI po raz drugi, z wykorzystaniem kontekstu bieżącej rozmowy i struktury plików twojego projektu.

Co to oznacza w praktyce:

  • Nazwy plików, ścieżki katalogów i nazwy zmiennych, które wymieniasz, są dopasowywane do ich rzeczywistych odpowiedników w projekcie.
  • Wszystko, co powiesz, a potem natychmiast skorygujesz, jest filtrowane — nie transkrybowane.
  • Rozproszone, nieliniowe myśli są reorganizowane według ważności i porządku logicznego.

Przykład: pracujesz z config/app.yaml i chcesz zmienić port na 8080. Mówisz:

„Zmień port w tym pliku konfiguracyjnym — tym appowym, tym, przy którym pracowałeś — na 8080. Chyba raz już go zmieniłem, ale chyba nie zadziałało..."

Standardowe narzędzie do dyktowania transkrybuje ten bałagan dosłownie. Deep Code daje ci:

„Zmień pole port w config/app.yaml na 8080."

Mów swobodnie. Potykanie się jest w porządku.

O to w tym chodzi.

Standardowe dyktowanie karze za niechlujną mowę — każde słowo jest rejestrowane, więc pomyłka oznacza zaczynanie od nowa. Moduł wprowadzania głosowego odwraca to założenie. Mów, jak chcesz. System to posprząta.

Automatycznie obsługuje:

  • Korekty w połowie zdania: wcześniejsza, zaprzeczona treść jest odrzucana.
  • Mgliste odwołania: „ten plik", „ten z wczoraj", „ta rzecz, o której właśnie rozmawialiśmy" — rozwiązywane z kontekstu.
  • Powtórzenia: zduplikowane pomysły są deduplikowane.
  • Wypełniacze: yyy, eee, no, wiesz — usuwane.

Przekaż istotę. System zrobi resztę.

Przełączanie kodu i mieszane terminy

Deweloperzy nieustannie mieszają terminy techniczne w codziennej mowie — nazwy plików, nazwy funkcji, nazwy frameworków, polecenia CLI. Ogólne narzędzia głosowe są w tym fatalnie złe, często przekręcając useSnippets.ts do bezsensownej formy lub rozbijając npm install na losowe słowa.

Moduł wprowadzania głosowego jest zoptymalizowany pod konteksty programistyczne. Odwołuje się do drzewa plików twojego projektu, by wiedzieć, co jest prawdziwym identyfikatorem, a co szumem:

  • Nazwy plików jak useSnippets.ts i src/utils/index.ts są zachowane w całości.
  • Nazwy zmiennych i funkcji są rozpoznawane poprawnie.
  • Nazwy frameworków i narzędzi (Java, C++, npm, git) po prostu działają.

Nie spiesz się — nagrywaj do 5 minut

Większość narzędzi do wiadomości głosowych ogranicza cię do 60 sekund i uruchamia odliczanie, które sprawia, że wszystko jest nerwowe.

Deep Code obsługuje ciągłe nagrywanie do 5 minut. Myśl we własnym tempie. Zatrzymaj się, gdy potrzebujesz. Żaden zegar nie tyka.

Jak z niego korzystać

Moduł wprowadzania głosowego znajduje się w prawym dolnym rogu okna Deep Code. Żadnych menu do otwierania, żadnych paneli do przełączania — jest zawsze na miejscu.

Krok 1: Rozpocznij nagrywanie

Najedź kursorem na przycisk nagrywania w prawym dolnym rogu, by zobaczyć podpowiedź. Kliknij, by rozpocząć.

Krok 2: Mów

Podczas nagrywania przycisk pokazuje żywą falę dźwiękową odzwierciedlającą poziomy audio. Jesteś rejestrowany w czasie rzeczywistym.

W trakcie nagrywania możesz:

  • Mówić, co ci przyjdzie do głowy, w dowolnej kolejności.
  • Samodzielnie korygować lub ignorować pomyłki — system sobie z nimi poradzi.
  • Robić pauzy na zastanowienie — nagranie dalej trwa. Wznów, gdy będziesz gotowy.

Krok 3: Zatrzymaj nagrywanie

Kliknij ten sam przycisk, by zatrzymać. Audio jest przesyłane i rozpoczyna się transkrypcja.

Krok 4: Przejrzyj i wyślij

Po zakończeniu transkrypcji zobaczysz przetworzony tekst do przejrzenia. Stąd możesz:

  • Sprawdzić, czy tekst doprecyzowany przez AI odpowiada twojej intencji.
  • Bezpośrednio edytować tekst, jeśli trzeba.
  • Wstawić odwołania do plików z panelu eksploratora plików.
  • Wstawić szablony promptów z panelu snippety.
  • Kliknąć wyślij, gdy wszystko wygląda dobrze.

Wszystko odbywa się w jednym oknie — bez przełączania kontekstu.

Porównanie

Ogólne narzędzia głosowe (Siri, Google dictation itp.)Wprowadzanie głosowe Deep Code
PrzeznaczenieCodzienny czat, notatki, wyszukiwanieSterowanie AI — rozumie, co chcesz zrobić
TranskrypcjaStrumieniowa, słowo po słowie podczas mówieniaAI przetwarzające kontekst, uporządkowane przed wyjściem
Styl myśleniaWymaga liniowej, ostrożnej mowySwobodne, nieliniowe — mów, co ci przyjdzie do głowy
Obsługa pomyłekZacznij od nowaFiltrowane i korygowane automatycznie
Terminy techniczneCzęsto przekręca identyfikatory koduRozpoznaje pliki projektu, nazwy funkcji, polecenia CLI
Limit czasuZazwyczaj ~60 sekundDo 5 minut
Świadomość projektuBrakGłęboka integracja z panelem eksploratora plików i snippety

Podsumowanie

Moduł wprowadzania głosowego to nie narzędzie do transkrypcji mowy na tekst — to pomost między myślami a instrukcjami. Bierze to, jak naturalnie myślisz i mówisz, i zamienia w coś, na co AI może zareagować.

Jedna rzecz do zapamiętania:

Mów swobodnie. System resztę ogarnie.