-
Notifications
You must be signed in to change notification settings - Fork 0
Korean Real Time Transcription
Dan edited this page Aug 21, 2026
·
1 revision
실시간 전사는 녹음이 진행되는 동안 녹음 표시 아래에 인식된 텍스트를 보여줍니다. 설정 → 실시간 전사에서 활성화한 다음 정확히 한 가지 모드를 선택하세요.
블록 전사는 선택된 주요 Whisper 또는 Parakeet 모델을 재사용합니다. 녹음 중에 겹치는 오디오 창을 전사하고, 인식된 단어를 타임스탬프별로 병합하며, 텍스트가 일정하게 유지되면 안정적인 것으로 간주합니다. 녹음이 종료되면 Voice2Win이 누락된 끝부분을 추가하거나, 간격이 감지되면 전체 대체 전사를 수행합니다.
장점:
- 최종 전사와 동일한 주요 전사 모델 및 언어 선택 사용
- 별도의 스트리밍 인식기를 로드하지 않고도 긴 받아쓰기를 더 빨리 사용할 수 있음
- 이전 블록 결과를 수정하기 위해 문장 경계 주변에서 추가 시프트 검사를 실행 가능
요구 사항 및 트레이드오프:
- 그래픽 카드 가속용으로 설계되었으며, 오디오 전사가 메인 프로세서에 할당될 경우 사용 불가할 수 있음
- 선택한 모델과 겹치는 작업을 위해 충분한 그래픽 메모리 필요
- 더 자주 또는 더 큰 윈도우 사용 시 계산 사용량 증가
| 설정 | 기본값 | 효과 |
|---|---|---|
| 창 크기 | 10초 | 한 번의 메인 모델 실행에서 볼 수 있는 최대 오디오 길이입니다. 창이 클수록 문맥이 추가되지만 실행 시간이 길어집니다. |
| 홉 간격 | 3초 | 새 스냅샷 간의 시간입니다. 값이 작을수록 더 자주 갱신되며 더 많은 작업이 시작됩니다. |
| 겹침 / 문맥 | 20초 | 문맥과 병합을 위해 이전 오디오를 다시 포함합니다. |
| 안정 지연 | 6초 | 새 텍스트가 안정적이 되기 전에 변경되지 않고 유지되어야 하는 시간입니다. |
| 무음 시 시간 제한 | 1000밀리초 | 감지된 음성이 없을 때 이 기간 이후에 대기 중인 안정 텍스트를 수락합니다. |
| 추가 문장 경계 확인 | 2 | 문장 경계당 추가로 이동된 확인 횟수; 0이면 추가 실행이 비활성화됩니다. |
| 이동 계수 | 20퍼센트 | 추가 문장 창이 얼마나 멀리 이동되는지 제어합니다. |
출력 속도가 느리거나 안정성이 떨어질 경우 수동 조정 대신 기본값 복원을 사용하세요.
스트림 전사는 녹음과 병행하여 별도의 Sherpa-ONNX 온라인 인식기를 실행합니다. 이는 매우 초기의 임시 문장을 생성하며, 이후 주요 전사 모델이 겹치는 그룹 내에서 이를 다듬습니다.
장점:
- 가장 초기 단계에서 확인 가능한 임시 결과 제공.
- 메인 프로세서에서 실행 가능하며, Windows에서는 DirectML 그래픽 카드 가속으로 실행 가능.
단점:
- 현재 카탈로그에 스트림 모델이 존재하는 언어만 지원.
- 원시 임시 인식 결과가 최종 메인 모델 결과보다 거칠 수 있음.
- 선택한 언어나 모델 변형마다 추가 모델을 다운로드하고 캐시함.
- 런타임 환경 — 호환성을 위해 메인 프로세서를 선택하거나 속도를 위해 Windows 그래픽 카드를 선택하세요.
- 스트림 오디오 모델 — 더 빠름은 지연 시간과 로딩 시간을 최소화하고, 더 정확하지만 느림은 인식 품질을 위해 더 많은 연산을 사용합니다.
- 함께 정제할 문장 수 — 1~8문장 범위에서 겹치는 메인 모델 정제 창을 조절합니다; 기본값은 2입니다.
- 로드된 스트림 오디오 모델 — 캐시된 모델을 나열하고 삭제할 수 있습니다. 삭제된 모델은 필요 시 다시 다운로드됩니다.
녹음 표시기 아래 최대 텍스트 높이는 실시간 텍스트를 화면 높이의 10~90%로 제한하며, 기본값은 50%입니다. 더 긴 텍스트는 스크롤하여 볼 수 있으며, 최신 결과를 따라가다가 수동으로 위로 스크롤할 때까지 계속 표시됩니다.
- 주 모델의 동작을 원하고 그래픽 카드 성능과 메모리가 충분할 때 블록 전사를 선택하세요.
- 가능한 한 빨리 중간 텍스트가 필요하고 지원되는 언어를 사용할 때 스트림 전사를 선택하세요.
- 가장 간단한 파이프라인을 선호하고 녹음 후 최종 결과만 필요할 때 실시간 전사를 비활성화하세요.
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động