-
Notifications
You must be signed in to change notification settings - Fork 0
Korean Settings Reference
톱니바퀴 버튼으로 설정을 엽니다. **확인(OK)**은 변경 사항을 저장하고, **취소(Cancel)**는 변경 사항을 무시합니다. 모델, 런타임, 저장 위치 또는 네트워크 서비스에 영향을 주는 변경 사항은 적용하는 데 잠시 시간이 걸릴 수 있으며, 구성 요소가 다시 로드될 수 있습니다.
이 참조는 단순한 컨트롤 목록뿐만 아니라 튜닝 가이드로 의도되었습니다. 기본값은 대부분의 로컬 Windows 설치에서 좋은 출발점입니다. 관련 설정을 한 번에 하나씩 변경하고, 실제로 음성 입력하는 애플리케이션에서 테스트하며, 결과가 명확히 더 나아질 때까지 이전 값을 유지하세요.
| 목표 | 권장 시작 지점 |
|---|---|
| 일반 데스크톱 애플리케이션에서 신뢰할 수 있는 일상적 받아쓰기 | 고정된 전사 언어, 클립보드 삽입, 클립보드 복원 활성화, 기본 지연, 오디오 정상화 활성화 |
| 터미널 또는 원격 데스크톱에서 받아쓰기 | 클립보드 전달이 불가능한 경우 먼저 유니코드를 시도하십시오. 그렇지 않으면 클립보드를 유지하고 원격 대상에서 허용하는 붙여넣기 단축키를 선택하십시오. 물리 키와 유사한 입력에만 안정적으로 응답하는 애플리케이션에는 스캔 코드를 사용하십시오. |
| 긴 문서 | 고정 언어, 발음 부호, 연속 서식, 래치 또는 하이브리드 단축키 모드, 저장된 WAV 녹음 |
| 짧은 검색 필드, 채팅 및 명령 | 마지막 마침표 제거; 첫 글자 소문자 서식 선택 가능; 단축키 모드 유지로 녹음이 실수로 계속 활성화되는 것을 방지 |
| 조용하거나 개인정보가 중요한 사용 | 저장된 WAV 녹음을 비활성화하고, 전사 보관을 검토하며, 클립보드 모니터링 애플리케이션이 걱정된다면 클립보드 삽입을 비활성화하고, 원격 런타임을 피하십시오. | | 가장 낮은 지연 시간으로 인식 | 실시간 미리보기가 유용하지 않다면 비활성화하고, 빠른 로컬 전사 모델/런타임을 사용하며, 삽입 지연을 낮게 유지하고, 삽입 전에 AI 출력을 수집하지 마십시오. |
- 전사 언어: 가장 자주 사용하는 언어를 선택하세요. 고정 언어는 일반적으로 자동보다 더 빠르게 시작되고 안정적이며, 특히 짧은 받아쓰기, 이름, 비슷하게 들리는 단어에 유리합니다. 녹음 사이에 실제로 언어를 전환하는 경우에만 자동 감지를 사용하세요. 짧은 문구에서는 언어 감지에 충분한 근거가 없어서 잘못 선택할 수 있습니다.
- 사용자 정의 전문 용어 및 이름: 일반적이지 않은 이름, 제품 용어, 약어 및 Whisper가 선호하도록 하는 철자를 추가하세요. 목록을 집중적으로 유지하세요: 이는 인식 안내용이지만 보장된 검색 및 교체 규칙은 아니며, 일반 단어가 많은 목록은 원하지 않는 편향을 유발할 수 있습니다. 이 지침은 Whisper용이며, 다른 전사 엔진에서는 같은 방식으로 사용되지 않을 수 있습니다.
최적의 입력 방법은 대상 애플리케이션에 따라 다릅니다. 단순한 편집기에서만 테스트하지 말고, 사용 중인 가장 어려운 프로그램에서 테스트하세요.
-
클립보드: Windows에서 일반적으로 가장 좋고, 긴 텍스트, 특수 문자 및 복잡한 유니코드에 대해 보통 가장 빠른 선택입니다. Voice2Win은 일시적으로 클립보드를 대체하고, 붙여넣기 명령을 전송하며, 이전 내용을 복원할 수 있습니다. 클립보드 관리자나 다른 애플리케이션이 임시 텍스트를 관찰할 수 있고, 원격 세션에서는 클립보드 전달이 비활성화될 수 있습니다.
-
유니코드: 레이아웃에 의존하지 않으며, 원격 세션, 비Windows 시스템, 현재 키보드 레이아웃에 없는 문자가 포함된 텍스트에 대한 첫 번째 대체 옵션으로 좋습니다. 일부 게임, 터미널, 레거시 애플리케이션 및 권한 상승 창에서는 시뮬레이션된 유니코드를 신뢰성 있게 받을 수 없습니다.
-
스캔 코드: 물리적 키보드 입력과 가장 유사하게 동작하며, 오래되었거나 특이한 대상 애플리케이션에서 유용할 수 있습니다. 활성 키보드 레이아웃에 따라 다르며, 해당 레이아웃에 맞는 키가 없는 문자는 누락되거나 잘못될 수 있습니다. 긴 텍스트의 경우 일반적으로 단일 클립보드 붙여넣기보다 느립니다.
-
키보드 시뮬레이션 지연(0–50 ms): 유니코드나 스캔 코드 삽입에서 문자가 사라지거나 순서가 바뀌지 않는다면 낮게 유지하세요. 느린 애플리케이션, 가상 머신 또는 원격 데스크톱에서는 작은 단계로 증가시킵니다. 이 설정은 시뮬레이션된 키 입력 속도만 늦출 뿐, 음성 인식 성능을 향상시키지는 않습니다.
-
문제가 있는 대상 응용 프로그램에 클립보드 사용: 유니코드 또는 스캔 코드를 사용할 때 클립보드 사용이 금지되지 않았다면 이 기능을 활성화 상태로 유지하세요. Voice2Win은 시뮬레이션 입력을 잘 받지 않는 알려진 응용 프로그램에서 클립보드를 대체 수단으로 사용할 수 있습니다. 클립보드 프라이버시 또는 클립보드 전달이 이유로 키보드 시뮬레이션을 의도적으로 선택한 경우에만 비활성화하세요.
-
삽입 전 대기 시간 (0–2000 ms, 기본값 40 ms): 새 클립보드 값이 붙여넣을 단축키가 전송되기 전에 사용 가능해질 때까지의 시간. 대상이 이전 클립보드 값을 가끔 붙여넣거나 아무 것도 붙여넣지 않을 때, 특히 원격 클립보드 동기화를 통해 발생할 경우 이 값을 늘리십시오. 더 큰 값은 모든 삽입에 동일한 지연을 추가합니다.
-
붙여넣기 키 조합: 일반 Windows 애플리케이션에는 Ctrl+V를 사용하십시오. 터미널, 원격 데스크톱, 또는 AI 도구가 Ctrl+V를 일반 텍스트 붙여넣기가 아닌 다른 용도로 처리할 때는 Ctrl+Shift+V 또는 Shift+Insert를 시도해 보십시오. 최종 대상에서 예상하는 단축키를 선택하십시오, 반드시 로컬 원격 데스크톱 창에서 예상되는 단축키가 아닐 수도 있습니다.
-
AI 향상 중 텍스트를 수집하여 한 번에 삽입: AI 진행 출력이 커서를 이동시키거나, 서식을 적용하거나 자동완성을 트리거하거나 여러 단계의 실행 취소를 생성할 때 이 기능을 활성화합니다. 결과를 가능한 한 빨리 보는 것이 더 중요할 때는 비활성화하세요; 수집은 AI 결과가 완료될 때까지 아무것도 삽입하지 않고 기다립니다.
-
이전 클립보드 복원: 일반 작업 시에는 이 기능을 활성화해 두어 Voice2Win이 받아쓰기 전에 복사한 내용을 삭제하지 않도록 합니다. 받아쓰기 결과를 클립보드에 남기고 싶거나, 붙여넣기 단축키를 실행한 후 특정 대상이 클립보드를 읽도록 의도한 경우에만 비활성화하세요.
-
복원 전 대기 시간 (0–2000 ms, 기본값 120 ms): 이전 클립보드 값이 너무 빨리 복원되어 대상이 아무것도 입력하지 않거나 일부 텍스트만 입력할 경우 값을 늘리세요. 필요한 만큼만 높게 유지하세요: 이 시간 동안 받아쓰기된 텍스트는 클립보드를 인식하는 응용 프로그램에서 사용할 수 있습니다.
이 옵션들은 텍스트가 삽입되기 전에 인식된 텍스트를 수정합니다. 받아쓰기가 일관된 패턴을 따를 때 가장 유용합니다.
-
말로 하는 구두점: 긴 산문에서 '쉼표', '물음표'와 같은 구문 또는 해당 언어의 대응 구두점을 구두에서 변환하고 싶을 때 활성화하세요. 이러한 단어가 문자 그대로 콘텐츠일 수 있거나 음성 인식 모델의 자동 구두점을 선호할 때는 비활성화하세요.
-
끝 마침표 제거: 검색 필드, 채팅 메시지, 양식 필드, 파일 이름, 음성 명령 등에서 자동으로 추가되는 마지막 마침표가 필요 없을 때 유용합니다. 문서나 이메일에서 완전한 문장에는 그대로 두세요.
-
첫 글자 소문자: 받아쓰기가 기존 문장의 중간에 삽입될 때 유용합니다. 새로운 문장, 제목, 이름, 독립적인 메시지에는 비활성화하세요.
-
동일한 애플리케이션에서 연속된 받아쓰기를 연결: 여러 녹음을 하나의 단락으로 구성할 때 활성화하세요; Voice2Win이 그 사이의 간격과 문장 맥락을 유지할 수 있습니다. 연속된 녹음이 일반적으로 다른 필드로 들어가거나 받아쓰기 사이에 커서를 자주 수동으로 이동할 경우 비활성화하세요.
-
음성 감지 민감도 (0–100, 기본값 35%): 값이 낮으면 조용한 음성도 인식할 수 있지만, 숨소리, 클릭음, 배경 소음도 음성으로 인식될 수 있습니다. 값이 높으면 소음을 더 적극적으로 걸러내지만, 작은 목소리나 단어의 끝부분을 인식하지 못할 수 있습니다. 기본값에서 시작하여 입력 레벨을 확인하면서 조금씩 조정하세요. 마이크를 가까이 대는 것이 극단적인 값을 사용하는 것보다 더 나은 경우가 많습니다.
-
녹음 시작 부분 정리 (0–500 ms, 기본값 250 ms): 시작 부분의 단축키 클릭, 처리 소음, 선행 침묵을 억제합니다. 녹음 초반에 키 클릭 소리가 포함된다면 값을 늘리고, 첫 음절이 잘리거나 단축키를 누른 직후 매우 짧은 단어를 말하는 경우라면 값을 줄이세요.
-
녹음 정규화 (기본값 켜기, 목표 85%): 일반 마이크와 발화 거리 변화가 있는 경우 권장됩니다. 모델에 더 일관된 레벨을 제공하기 때문입니다. 이미 정규화된 스튜디오/가상 입력의 경우 또는 정규화로 인해 지속적인 배경 소음이 눈에 띄게 증가할 때는 비활성화하세요. 목표 값은 마이크 게인 조절이 아니며, 클리핑된 오디오를 복구할 수 없습니다.
-
WAV 녹음 저장 (기본값 켜기): 재생, 재전사, 품질 비교 또는 진단 증거가 필요할 때 활성화 상태로 유지하세요. 저장 공간 사용량이나 기밀이 더 중요할 경우 비활성화하세요. 오디오는 일반적으로 텍스트보다 훨씬 많은 공간을 차지합니다.
-
저장된 WAV 녹음 삭제: 전사 텍스트는 유지한 채 저장된 오디오를 제거합니다. 재생이나 재전사가 더 이상 필요하지 않음을 확인한 후 사용하세요; 삭제한 오디오는 원본 그대로 복원할 수 없습니다.
- 누르고 있기: 단축키를 누르고 있는 동안만 녹음이 지속됩니다. 짧고 자주 하는 기록에 가장 적합하며, 배경 녹음이 실수로 시작되는 것을 방지할 때 가장 안전한 모드입니다.
- 래치: 한 번 눌러 시작하고 다시 눌러 중지합니다. 긴 구간, 접근성 용도 또는 핸즈프리 말하기에 가장 적합하지만, 중지할 때 의도적인 동작이 필요합니다.
- 하이브리드 / 더블 탭: 짧게 녹음하려면 누르고, 래치하려면 두 번 탭합니다. 혼합 작업에 가장 유연한 기본 설정입니다. 때때로 실수로 더블 탭을 해서 녹음이 계속될 수 있는 경우에는 대신 누르고 있기를 사용하세요.
-
음성을 텍스트로 변환과 음성 명령에 대해 별도의 단축키를 지정하세요. 운영 체제, 키보드 드라이버, 원격 데스크톱 또는 대상 애플리케이션에서 이미 사용 중인 조합은 피하는 것이 좋습니다. 중복된 Voice2Win 단축키는 거부됩니다.
-
Windows에서는 Voice2Win이 일반적으로 높은 권한으로 실행 중인 애플리케이션에 주입할 수 없습니다. 높은 권한을 요구하는 애플리케이션에 실제로 받아쓰기를 해야 하는 경우에만 Voice2Win을 관리자 권한으로 실행하세요; 전역 입력 접근 권한을 높이면 애플리케이션이나 구성 오류의 영향이 커집니다.
-
단축키를 누르는 동안 전역 오디오 출력을 음소거 옵션은 스피커 사용 시 유용합니다. 시스템 오디오가 마이크로 다시 들어가는 것을 방지할 수 있습니다. 녹음 중 회의나 미디어 소리를 들어야 하거나 헤드폰을 사용할 때는 이를 비활성화하세요.
-
표시기가 보이지 않을 때 래치/하이브리드 상태를 명확하게 하기 위해 시작 및 정지 신호를 분리합니다. 스피커를 사용할 때는 마이크가 소리를 잡지 않도록 소리를 짧고 조용하게 유지하세요. 신뢰할 수 없는 단축키 감지를 해결하기 위해서가 아니라 접근성을 위해 지속 시간이나 볼륨을 늘리세요.
- 인터페이스 언어는 메뉴와 레이블만 변경하며, 전사(트랜스크립션) 언어를 선택하지 않습니다.
- 다크 테마는 시각적 선호 설정일 뿐이며, 인식이나 성능에는 영향을 주지 않습니다.
- 지시기 스타일(Indicator style): 단순한 레벨 표시가 가장 덜 산만합니다; 파형이나 막대형은 음성 활동을 판단하기 쉽습니다; 스펙트럼 스타일 표시기는 더 많은 세부 정보를 보여주지만 시각적으로 더 복잡합니다. 대상 애플리케이션을 가리지 않으면서 마이크 활동을 확인하는 데 도움이 되는 스타일을 선택하세요.
- 색상 구성, 위치, 크기: 고대비 구성을 사용하고, 툴바, 캡션, 텍스트 캐럿에서 떨어진 위치에 두세요. 더 큰 지시기는 접근성과 실시간 텍스트에 도움이 되며, 더 작은 지시기는 녹음 상태만 중요할 때 좋습니다.
-
자동 시작 비활성화는 Voice2Win을 가끔 사용할 때 가장 적합합니다. 레지스트리 자동 시작은 로그인 후 시작을 위한 일반적인 Windows 선택입니다. 작업 스케줄러는 시작 순서나 관리자 실행(elevated execution)이 필요할 때 유용합니다. 리눅스에서는 앱이 사용자별 데스크톱 자동 시작 메커니즘을 사용합니다.
-
작업 스케줄러로 관리자 권한 실행은 반드시 관리자 애플리케이션에 입력해야 하는 경우가 아니면 꺼 두어야 합니다. 승격(Elevation)은 성능 옵션이 아니며, 전역 키보드 접근의 보안 경계를 변경합니다.
-
자동 시작 확인 대화 상자 표시는 새 자동 시작 설정을 검증하거나 공유 컴퓨터에서 유용합니다. 시작을 신뢰하고 자동화하려는 경우에만 비활성화하십시오.
-
스플래시 화면 표시는 모델/런타임 초기화에 눈에 띄는 시간이 걸릴 때 도움이 됩니다. 더 조용한 트레이 스타일 시작을 원하면 비활성화하십시오.
-
준비 완료 소리는 시작 및 모델 준비가 완료되었음을 확인시켜 주며, 특히 Voice2Win이 최소화 상태로 시작될 때 유용합니다. 조용한 환경에서는 비활성화하세요; 인식될 수 있을 정도로만 지속 시간과 볼륨을 조절하세요.
-
**닫기 시 최소화(기본 켬)**는 메인 창을 닫은 후에도 글로벌 단축키를 사용할 수 있게 합니다. 창 닫기 버튼이 애플리케이션 종료 기능을 해야 할 경우 비활성화하세요.
-
**업데이트 자동 확인(기본 켬)**은 수정 사항, 모델/런타임 호환성, 보안 업데이트를 위해 권장됩니다. 의도적으로 관리되는 설치나 오프라인 설치의 경우에만 비활성화하고, 대신 수동으로 확인하세요.
-
주간 정보 대화 상자 비활성화는 더 이상 필요하지 않은 반복 정보 알림을 숨깁니다; 기능 메시지나 오류 메시지는 비활성화되지 않습니다.
-
리눅스 입력 자동화 상태는 진단 정보입니다. X11 호환 입력 자동화가 지원됩니다; 순수 Wayland 세션에서는 전역 단축키와 텍스트 주입이 제한될 수 있습니다. 사용할 수 없는 경우, X11 세션이나 데스크탑 환경에서 제공하는 호환 모드를 사용하세요.
-
전사 저장 경로: 신뢰할 수 있는 로컬 폴더를 선택하세요. 민감한 녹음을 위해 암호화된 위치를 사용하고, 백업/동기화 소프트웨어가 아직 작성 중인 파일과 충돌하지 않도록 하세요. 느리거나 간헐적으로 사용 가능한 네트워크 드라이브는 기록 작업을 지연시킬 수 있습니다.
-
이전 전사 삭제 / 최대 보존 기간: 개인정보 보호 정책이나 디스크 사용량이 중요할 때 자동 보존 설정을 활성화하세요. 현실적인 수정 및 재전사 기간을 여전히 커버할 수 있는 기간을 선택하세요. 저장된 WAV 파일은 일반적으로 기록에서 가장 큰 부분을 차지합니다.
-
모델 저장 경로: 충분한 여유 공간이 있는 빠른 로컬 SSD를 선호하세요. 이동식 드라이브와 네트워크 드라이브는 모델 로딩을 덜 신뢰할 수 있게 만들며, 연결이 끊긴 드라이브는 모델이 없는 것처럼 보이게 할 수 있습니다.
-
사용자 지정 데이터 루트 사용 / 모든 애플리케이션 데이터 이동: 포터블 설정, 제어된 백업, 또는 시스템 드라이브에서 대용량 데이터를 유지하는 경우 유용합니다. 적절한 권한과 충분한 공간이 있는 폴더를 선택한 후 요청 시 다시 시작하세요. 이는 로컬 데이터를 이동하지만, 자동으로 암호화하거나 업로드하지는 않습니다.
실시간 전사는 사용자가 말하는 동안 미리보기를 제공하는 기능입니다. 일반 최종 전사가 권위 있는 최종 결과로 남습니다. 미리보기가 필요하지 않은 경우 실시간 모드를 비활성화하세요: 리소스 사용을 최소화하고 화면에 단어가 바뀌는 것을 방지할 수 있습니다.
- **블록(Block)**은 겹치는 오디오 위에서 메인 Whisper 전사 모델을 반복적으로 실행합니다. 최종 Whisper 결과와 유사한 미리보기를 원하고, 충분한 메모리를 가진 지원되는 GPU가 있을 때 선택하세요. 더 많은 컨텍스트를 제공하지만, GPU 작업이 상당히 반복적으로 발생합니다.
- **스트림(Stream)**은 별도의 Sherpa-ONNX 스트리밍 모델을 사용합니다. 가장 빠른 점진적 피드백이 필요하거나 블록 모드를 사용할 수 없을 때 선택하세요. 미리보기는 다소 거칠 수 있으며, 설정에 나열된 언어만 지원합니다. 최종 일반 전사는 여전히 다를 수 있습니다.
- **최대 표시 높이(Maximum display height)**는 미리보기가 화면에서 차지할 수 있는 최대 영역을 제한합니다. 장시간 접근성을 위해 높이세요; 표시기가 대상 애플리케이션을 가릴 때는 줄이세요. 인식 품질은 변경되지 않습니다.
기본값은 균형 잡혀 있고 상호 의존적입니다. 문제 해결 전에 기본값으로 복원하고 한 번에 하나의 매개변수만 변경하세요.
-
창 크기 (기본값 10초): 문장 맥락이 부족하거나 긴 구문이 스냅샷 간에 너무 많이 변경될 때 늘리세요. 창이 커지면 시간이 더 오래 걸리고 계산/메모리를 더 많이 사용합니다. 성능이 충분한 하드웨어에서는 개별 업데이트를 더 빠르게 수행하려면 줄이되, 맥락은 적게 허용합니다.
-
홉 간격 (기본값 3초): 미리보기 업데이트를 더 자주 하려면 줄이세요; GPU 부담이 너무 크면 늘리세요. 홉 간격이 좁으면 더 많은 전사 작업이 시작되지만 각 작업이 더 빨라지지는 않습니다.
-
중첩/맥락 (기본값 20초): 블록 경계에서 단어가 중복되거나 누락되거나 잘못 병합될 때 늘리세요. 반복 작업을 줄이려면 줄이세요. 중첩이 너무 적으면 인접한 스냅샷을 조정하는 데 필요한 증거가 사라집니다.
-
안정 지연(기본값 6초): 단어가 너무 일찍 확정되고 이후 맥락에서 수정될 수 있는 경우 이를 늘립니다. 안정된 텍스트가 너무 늦게 나타나면 줄여서 더 많은 수정 가능성을 허용합니다.
-
침묵 시간 제한(기본값 1000ms): 일시 정지 후 텍스트가 빨리 확정되어야 할 때 줄입니다. 자연스러운 머뭇거림이 생각을 너무 일찍 나누거나 마무리할 때 늘립니다.
-
추가 문장 경계 확인(기본값 2): 문장 전환이 반복적으로 잘못되고 GPU 여유가 있을 때만 늘립니다. 추가 전사마다 시간이 소요됩니다. 추가 실행을 비활성화하려면 0으로 설정합니다; 중앙 경계 확인은 여전히 유지됩니다.
-
Shift factor (기본값 20%): 추가 검증 창이 창 크기에 비해 얼마나 이동할지를 제어합니다. 경계 주변의 더 넓은 영역을 확인할 때 유용하면 값을 높이고, 주변 문맥만으로 충분하면 값을 낮춥니다. 추가 검증과 함께일 때만 중요합니다.
- 런타임: CPU는 가장 넓은 호환성을 제공합니다. DirectML은 지원되는 Windows GPU에서 지연 시간을 줄일 수 있지만, 메인 모델에서 필요할 수도 있는 GPU 자원을 사용합니다.
- 모델 변형: 낮은 지연 시간과 적은 자원 사용을 원하면 Fast를 선택하세요. 미리보기 품질이 속도보다 중요하면 Accurate를 선택하세요.
- 문장 정제 창 (1–8, 기본값 2): 값이 1이면 문장이 가장 빨리 완료됩니다. 더 큰 값은 문장 맥락을 더 많이 유지하여 정제하지만 완료가 늦어지고 작업 부담이 증가합니다. 기본값은 실용적인 균형입니다.
- 캐시된 모델: 사용하지 않는 캐시 모델을 삭제하면 디스크 공간이 확보됩니다. 해당 언어/런타임/모델 조합을 나중에 선택하면, 미리보기를 준비하기 전에 다시 다운로드해야 합니다.
전체 워크플로와 사용 가능 요건은 실시간 전사를 참조하세요.
- Whisper는 폭넓은 언어 지원과 확립된 모델 변형을 위해 일반적으로 선택됩니다. Parakeet은 지원되는 언어와 사용 가능한 하드웨어가 사용 사례와 맞을 때 매력적일 수 있습니다. 실제 녹음을 기반으로 선택하세요; 별점 및 속도 추정치는 지침일 뿐 마이크, 언어 및 어휘를 테스트하는 것을 대체할 수 없습니다.
- 더 크거나 높은 품질의 모델은 일반적으로 더 많은 메모리와 시간이 필요하지만 까다로운 오디오를 개선할 수 있습니다. 신뢰할 수 있을 정도로 정확한 가장 작은 모델부터 시작하세요. 메모리 부담이나 긴 대기열을 발생시키는 모델은 일관되게 완료되는 약간 작은 모델보다 덜 유용할 수 있습니다.
- 모델 관리자는 로컬 모델 파일을 다운로드하고 제거합니다. 선택된 엔진이나 오프라인 워크플로우에서 여전히 필요한 모델을 삭제하지 마세요.
-
오디오 전사와 AI 향상 작업을 독립적으로 할당하세요. 반복적인 로컬 작업에는 일반적으로 GPU가 가장 좋습니다; CPU는 호환성을 위한 대안이지만 훨씬 느릴 수 있습니다. 두 가지 작업을 장치에 나눠서 수행하면 두 작업을 동시에 사용할 때 GPU 메모리 충돌을 피할 수 있습니다.
-
Ollama 또는 LM Studio의 경우 서버 유형, 주소, 포트 및 로드된 모델을 선택하세요. 오직 신뢰할 수 있는 네트워크에서만 검색 기능을 사용하고, 선택한 모델이 실제로 서버에서 사용 가능한지 확인하세요.
-
원격 AI 서버나 다른 Voice2Win 컴퓨터를 통해 더 약한 기기에서 작업을 이동할 수 있지만, 네트워크 지연이 발생하고 해당 시스템으로 작업의 오디오나 텍스트가 전송됩니다. 신뢰할 수 있는 호스트와 네트워크에서만 사용하세요.
-
로컬 런타임 공유는 다른 신뢰할 수 있는 Voice2Win 설치가 필요할 때만 하세요. 암호를 사용하고, 포트를 의도한 네트워크 프로필에서만 방화벽을 통해 허용하며, 더 이상 필요하지 않을 때 공유를 비활성화하세요. 연결된 클라이언트 및 버전 경고는 예상치 못한 또는 호환되지 않는 클라이언트를 식별하는 데 도움이 됩니다.
-
컨텍스트 크기(기본값 4096): 긴 선택 텍스트, 긴 지시문 또는 주변 컨텍스트가 더 필요한 변환의 경우 이를 늘리세요. 컨텍스트가 클수록 더 많은 메모리를 사용하며 속도가 느려질 수 있습니다. 짧은 수정은 자동으로 개선되지 않습니다.
-
최대 토큰 수(기본값 512): 긴 재작성 내용이 잘릴 경우 이를 늘리세요. 응답 시간을 제한하고 예상치 못하게 긴 출력을 방지하려면 줄이세요. 일반적인 받아쓰기 수정에는 매우 큰 값이 거의 필요하지 않습니다.
-
온도(기본값 0.2): 낮은 값일수록 반복이 가능하며 수정, 형식화, 의미 보존에 가장 적합합니다. 의도적으로 창의적인 재작성을 원할 때만 높이세요. 값이 높을수록 단어나 사실이 더 자유롭게 바뀔 수 있습니다.
-
AI 향상을 위한 최소 전사 길이 (기본값 20자): 아주 짧은 문구도 처리해야 하는 경우 낮춥니다. 모델 시작/지연이나 ‘예’ 또는 이름과 같은 작은 입력에서 예상치 못한 재작성 방지를 위해 높입니다.
-
시스템 프롬프트: 이것은 기본 AI 향상을 위한 지속적 지침입니다. 원하는 언어, 의미와 톤을 유지해야 하는지 여부, 최종 텍스트만 반환될 것을 명시합니다. 중요한 텍스트가 아닌 곳에서 프롬프트 변경을 테스트하세요: 지나치게 광범위한 프롬프트는 받아쓰기를 답하거나 번역하거나 교정 대신 설명을 추가할 수 있습니다.
-
대체 AI 모델 저장소: 충분한 공간이 있는 빠른 로컬 드라이브를 사용하세요. 기존 모델을 복사하면 추가 다운로드가 필요하지 않습니다; 폴더만 변경해도 누락되었거나 호환되지 않는 모델이 사용 가능해지지 않습니다.
다음 자료를 참조하세요: AI 모델과 하드웨어 및 AI 향상.
-
화자 인식 모델 품질: 유사한 목소리를 구분하는 것이 중요하고 기계에 충분한 메모리/성능이 있는 경우, 높은 품질의 모델을 선호하세요. 제한된 하드웨어에서 긴 세션을 진행할 때는 더 가벼운 모델을 사용하세요. 다운로드된 모델은 즉시 선택할 수 있습니다.
-
화자 분리 감도: 기본값으로 시작하세요. 서로 다른 두 유사한 목소리가 반복적으로 합쳐질 경우 감도를 높이세요. 단점은 한 사람의 변화하는 목소리, 거리, 또는 마이크 각도에 따라 추가 화자로 분리될 수 있다는 것입니다. 한 사람이 반복적으로 여러 화자로 나타나는 경우에는 감도를 낮추세요. 단점은 실제로 유사한 목소리가 합쳐질 수 있다는 것입니다.
-
음성 감지 민감도: 클릭, 방 소음, 또는 무음 구간이 전사될 때 민감도를 높이세요. 조용한 화자가 누락될 때 민감도를 낮추세요. 이 게이트는 구간이 전사로 전송될지 여부를 결정합니다; 공격적으로 거부된 구간은 더 정확한 전사 모델로도 복구할 수 없습니다.
-
완료 대기 시간(기본값 10초, 대화 녹음 페이지): 화자가 말한 후 구간을 빨리 마무리해야 할 경우 짧은 대기 시간을 사용하세요. 긴 침묵 속에서 심사숙고하는 토론의 경우 긴 대기 시간을 사용하세요; 결과는 나중에 나타나지만 한 번의 발언이 나뉠 확률은 적습니다.
-
예상 화자 (기본값은 자동, 대화 녹음 페이지에서 설정): 참가자가 자유롭게 입장하거나 퇴장할 수 있는 경우 자동을 유지하세요. 자동 클러스터링이 잘못된 숫자를 생성할 때는 고정된 회의에 대해 알려진 인원 수를 설정합니다. 잘못된 고정 인원 수는 관련 없는 음성을 함께 묶거나 요청된 인원 수를 맞추기 위해 하나의 음성을 나눌 수 있습니다.
화자 분리는 확률적입니다. 마이크 거리, 겹침, 에코, 변하는 배경 소음이 영향을 미치며, 수동 화자 수정이 여전히 필요할 수 있습니다. 자세한 내용은 대화 녹음을 참조하세요.
이 개발자 전용 섹션에서는 동일한 로컬 네트워크에 있는 다른 컴퓨터의 마이크를 스트리밍하는 별도의 데스크톱 컴패니언 클라이언트를 구성합니다.
-
클라이언트 마이크가 필요할 때만 서비스를 활성화하세요. 클라이언트에서 접근 가능한 네트워크 어댑터를 선택하세요. VPN 및 가상 어댑터는 다른 컴퓨터가 도달할 수 없는 페어링 주소를 생성할 수 있습니다.
-
다른 서비스와 충돌하지 않는 한 기본 포트를 유지하세요. 클라이언트가 연결할 수 없는 경우, 포트를 무작위로 변경하기 전에 선택한 어댑터, 로컬 방화벽 및 두 시스템이 동일한 신뢰할 수 있는 네트워크에 있는지 확인하세요.
-
페어링 URL/토큰을 비밀로 취급하세요. 서비스에 접근할 수 있고 유효한 토큰을 가진 사람은 누구나 연결을 시도할 수 있습니다. 어댑터, 주소, 포트 또는 토큰을 변경한 후 URL을 다시 생성하거나 다시 배포하세요.
-
연결된 클라이언트 상태는 어떤 클라이언트가 사용 가능한지와 그 기능을 보여줍니다. 오디오는 녹음 장치로 선택된 클라이언트에서 스트리밍됩니다. 단순히 클라이언트를 연결하는 것만으로 모든 연결된 마이크가 동시에 녹음되는 것은 아닙니다.
-
클라우드 중계가 없습니다. 이는 개인정보 보호를 향상시키지만, 라우팅, 방화벽, 절전 모드, Wi-Fi 품질이 사용 가능성과 지연 시간에 직접적으로 영향을 미친다는 것을 의미합니다.
Companion Client를 참조하세요.
- AI 향상 및 실시간 미리보기가 비활성화된 상태에서 하나의 대상 애플리케이션에서 문제를 재현합니다.
- 잘못된 단어의 경우, 마이크 수준/잡음을 조정하고, 고정 언어를 선택한 다음, 텍스트 삽입 설정을 변경하기 전에 다른 전사 모델을 테스트합니다.
- 올바른 텍스트가 잘못 삽입된 경우, 먼저 삽입 방식을 변경하고, 다음으로 붙여넣기 단축키를 변경한 후, 관련 지연만 증가시킵니다.
- 조용한 발화가 누락된 경우, 음성 감지 민감도를 약간 낮추고; 잡음이 음성으로 해석되는 경우, 민감도를 약간 높입니다.
- 높은 부하 발생 시, 최종 전사 품질을 낮추기 전에 실시간 모드를 비활성화하거나 홉 간격을 늘립니다.
- 여러 변경으로 인해 결과 해석이 어려워진 경우, 해당 섹션의 기본값을 복원합니다.
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động