Skip to content

Releases: lchata372-afk/subtle-releases

v0.6.0

Choose a tag to compare

@lchata372-afk lchata372-afk released this 24 Aug 12:47

반복 자막이 크게 줄었습니다

음악·정적처럼 대화가 없는 구간에서 같은 문장이 계속 반복돼 나오던 자막(음성 인식
환각)을 감지해 정리합니다. 크레딧·엔딩 구간에서 특히 체감이 큽니다 — 실제 대사가
반복되는 연출(같은 말을 몇 번 외치는 장면 등)은 그대로 보존됩니다.

인사말로 도배된 자막을 감지해 정리합니다

대화가 거의 없는 영상에서 음성 인식이 "시청해 주셔서 감사합니다" · "안녕히 주무세요"
같은 방송 마무리 인사를 영상 전체에 만들어내는 경우가 있습니다. 이런 상투구가 자막에서
일정 비중을 넘으면 이제 자동으로 감지해 위치와 상관없이 정리하고, 남은 자막도 신뢰도가
낮을 수 있다
는 경고를 함께 표시합니다. 숨소리·짧은 감탄사가 대부분인 소재에서도 비중을
정확히 판정하며, 상투구가 아닌 개별적인 문장은 그대로 남습니다.

화자 경계 감지를 켤 수 있습니다 (실험적)

작업 설정에 "화자 경계 감지(SCD)" 토글이 생겼습니다. 모델 매니저에서 전용 모델
(약 6MB)을 설치한 뒤 켜면:

  • 화자가 바뀌는 지점에서 여러 사람의 대사가 한 자막으로 뭉치는 일이 줄어들고,
  • 한국어 번역에서 같은 인물의 존댓말/반말이 큐마다 널뛰던 문제가 완화됩니다.

기본은 꺼짐이며, 켜지 않으면 기존과 완전히 동일하게 동작합니다.

새 기능: 소재 프로파일

작업 설정에 "소재 프로파일" 선택이 생겼습니다. 기본값(표준)은 기존과 동일하고,
"저음량·숨소리 많은 소재"(ASMR 등)를 선택하면 웃음·숨소리·감탄사가 연달아
반복되는 실제 발성이 환각으로 오인되어 지워지던 것을 보존합니다.

  • 이 프로파일을 켜면 안내가 함께 표시됩니다: 일부 호스팅 번역 서비스는 이런 소재를
    정책상 거부하거나 순화할 수 있어 로컬(custom) 번역을 권장하며, 화자 경계 감지는
    이 소재 부류에서 오탐이 늘 수 있어 끄기를 권장합니다.

자막 형식이 다듬어졌습니다

  • 인접한 자막 사이에 **최소 간격(2프레임)**을 보장합니다 — 자막이 거의 붙은 채
    교체되며 깜빡이듯 보이던 미세 간격이 사라집니다.
  • 두 줄 자막의 줄바꿈이 **아랫줄이 길거나 같은 모양(피라미드형)**을 우선합니다 —
    업계 표준 관행으로, 읽기 흐름이 자연스러워집니다.
  • 한국어 읽기 속도(CPS) 계산이 영문·숫자를 0.5자로 집계해 정확해졌습니다 —
    영문이 섞인 자막의 표시 시간이 불필요하게 길어지던 것이 줄어듭니다.

번역 결과 검사가 강화되었습니다

번역 자막에 원어(가나) 문자가 남은 경우에 더해, 중국어(간체) 문자가 섞여 나온
경우에도 경고
를 표시합니다. 일부 로컬 번역 모델이 드물게 다른 언어로 응답하는
문제를 바로 알아챌 수 있습니다(자동 수정은 하지 않습니다).

번역이 일시적인 지연·오류에 더 강해졌습니다

  • 번역 서버의 응답이 일시적으로 늦어 시간 초과가 났을 때 한 번 더 시도합니다 —
    순간적인 지연 때문에 일부 문장이 원문 그대로 남던 일이 줄어듭니다.
  • 문장이 한두 개뿐인 아주 짧은 영상에서 번역 응답 문제가 작업 전체 실패로 이어지던
    것을 고쳤습니다 — 이제 해당 문장만 원문으로 남기고 완주하며 경고로 알려 드립니다.

알아두세요

  • 업그레이드 후 같은 영상을 다시 돌리면 번역이 한 번 새로 실행됩니다. 내부 번역
    지시문이 개선되면서 기존 번역 캐시가 이번 버전과 호환되지 않습니다 — API 번역을
    쓰신다면 1회 재과금이 발생하고, 로컬 번역은 시간만 더 걸립니다. 전사(음성 인식)
    캐시는 그대로 재사용됩니다.
  • 리눅스 패키지가 약 130MB 커졌습니다 — 화자 경계 감지용 라이브러리가 동봉되기
    때문입니다(기능을 켜지 않아도 크기는 포함됩니다. 다음 버전에서 선택 다운로드로
    바꾸는 것을 검토 중입니다).

설치

플랫폼별 파일과 자동 업데이트 동작은 저장소 README를 참고하세요. 이 빌드는 코드 서명이 없어
Windows에서는 경고가 뜨고 macOS는 아직 지원하지 않습니다.

v0.5.0

Choose a tag to compare

@lchata372-afk lchata372-afk released this 19 Aug 09:33

Windows: 설치하면 바로 자막이 만들어집니다

지금까지 Windows에서는 설치 후 음성 인식 엔진(whisper)을 직접 내려받아 등록해야
첫 자막을 만들 수 있었습니다. 이번 버전부터 엔진이 설치 파일에 들어 있습니다
설치하고 영상을 넣으면 끝입니다. 설치 파일 크기는 3MB 정도만 늘었습니다.

Windows + NVIDIA GPU: 클릭 한 번으로 10배 빠르게

NVIDIA 그래픽카드가 있다면 설정 → GPU의 "CUDA 자동 설치 (646MB)" 버튼을 눌러
보세요. GPU 가속 엔진을 자동으로 내려받아 설치·등록까지 해 줍니다(별도 프로그램
설치 불필요). 등록되면 옆의 "활성화"를 눌러 전환합니다.

실측으로 large-v3-turbo 모델이 약 10배 빨라집니다 — CPU에서는 영상보다 느리던
전사가(1시간 영상에 2시간 이상) GPU에서는 4배속 이상으로 끝납니다. 기본 동봉 엔진은
CPU용이므로, GPU가 있다면 이 버튼이 이번 버전에서 가장 체감이 큰 기능입니다.

  • GPU 설정 화면의 각 항목에 무엇을 어떻게 구하는지 안내가 붙었습니다. 직접
    파일을 등록하는 경우, 등록은 경로를 기억하는 방식이므로 등록한 폴더를 옮기거나
    지우면 안 됩니다
    (화면에도 안내됩니다).

모델 추천·안내 개선

  • 하드웨어 감지 추천이 바뀌었습니다: GPU가 없거나 VRAM이 작아도 이제 base 대신
    large-v3-turbo-q5_0을 추천
    합니다. base 계열은 일본어 등 비영어 음성에서 오인식이
    많아 번역 입력용으로 부적합하기 때문입니다 — 속도는 느려져도 쓸 수 있는 결과가
    낫습니다.
  • 작업 설정에서 base 계열 + 영어 외 원어 조합을 고르면 경고가 표시됩니다
    (빠른 미리보기 용도로는 그대로 쓸 수 있습니다).
  • 모델 매니저에 양자화(q5 등) 안내를 추가했습니다: 양자화의 이득은 메모리·디스크
    절약
    입니다. GPU에서는 속도가 원본(f16)과 비슷하거나 오히려 느릴 수 있으니, VRAM이
    충분하면 원본 모델을 쓰세요.

같은 영상을 다시 돌릴 때 더 똑똑해졌습니다

같은 영상을 더 높은 품질의 모델로 이미 전사한 적이 있다면, 낮은 모델로 다시 돌려도
그 결과를 즉시 재사용합니다(전사 생략 — 품질은 같거나 더 좋음). 이때 작업 경고에
"상위 모델 캐시를 재사용했습니다"라고 표시되니, 요청한 모델로 꼭 새로 전사하고 싶다면
설정에서 캐시를 비우면 됩니다.

자막 표시 수정

  • 빠른 대사 구간에서 자막이 화면 폭을 크게 넘던 문제를 수정했습니다. 짧은 대사가
    쉴 새 없이 이어지는 구간(속사포 대화)에서 여러 문장이 한 자막으로 뭉쳐 규격을 넘던
    것이, 이제 폭 안에 들어가는 만큼만 묶입니다.
  • 예기치 않은 오류 안내가 실재하는 경로(설정 → 문의·버그 신고)를 가리키도록
    고쳤습니다.

설치

플랫폼별 파일과 자동 업데이트 동작은 저장소 README를 참고하세요. 이 빌드는 코드 서명이 없어
Windows에서는 경고가 뜨고 macOS는 아직 지원하지 않습니다.

v0.4.0

Choose a tag to compare

@lchata372-afk lchata372-afk released this 19 Aug 05:35

전사 방식 전면 개선

이번 버전의 핵심입니다. 실제 애니메이션·영화 소재를 사람이 만든 자막과 한 줄 한 줄
대조하는 검증을 거쳐, 전사(음성 인식) 단계를 새로 설계했습니다.

  • 배경음악 위의 대사가 통째로 빠지던 문제를 해결했습니다. 액션 장면·BGM이 깔린
    대화에서 수십 초 분량의 자막이 사라지던 원인을 찾아 제거했습니다.
  • 노래 가사가 전사되지 않던 문제를 해결했습니다. 오프닝·엔딩·삽입곡 구간도 이제
    자막이 나옵니다.
  • 자막이 실제 말보다 수십 초 먼저 나오던 시간 어긋남을 해결했습니다.
  • 처리 속도도 소폭 빨라졌습니다.

이전에 "음성 구간 감지(VAD)"를 꺼 두셨다면 "자동 구간 분할"을 다시 켜 주세요.
예전 버전에서 자막 누락 때문에 이 옵션을 껐던 분이 이번 개선의 가장 큰 수혜자입니다 —
새 방식은 그 문제가 없고, 끄기는 이제 문제 진단용 기능입니다. 또한 VAD 모델 다운로드가
더 이상 필요하지 않습니다(이미 설치했어도 무해합니다).

고유명사 표기 자동 고정

등장인물 이름이나 작품 고유 용어가 한 편 안에서 표기가 바뀌던 문제(예: 같은 인물이
"란마"와 "난마"로 번갈아 나오던 것)를 해결했습니다. 영상 전체에서 반복 등장하는
고유명사를 자동으로 찾아 표기를 한 번 확정한 뒤, 모든 번역에 일관되게 적용합니다.

  • 직접 만든 용어집을 지정했다면 그 표기가 항상 우선합니다.
  • 원치 않으면 CLI의 --no-auto-glossary로 끌 수 있습니다.

설치

플랫폼별 파일과 자동 업데이트 동작은 저장소 README를 참고하세요. 이 빌드는 코드 서명이 없어
Windows에서는 경고가 뜨고 macOS는 아직 지원하지 않습니다.

v0.3.1

Choose a tag to compare

@lchata372-afk lchata372-afk released this 17 Aug 12:23

새로운 기능

문의·버그 신고 — 설정 화면에서 바로 문의를 보낼 수 있습니다. 가입이나 로그인은 필요
없습니다. 앱 버전과 최근 오류 정보를 함께 보낼지 고를 수 있고, 보내기 전에 그 내용을 직접
보고 고칠 수 있습니다
(전체 파일 경로 같은 개인 정보는 담기지 않습니다). 답장을 원하시면
연락처를 남기실 수 있습니다.

전사·번역 재사용 — 같은 영상을 다시 처리하면 전사와 번역을 재사용합니다. 작업을 중간에
취소했다가 다시 실행해도 이미 끝난 번역은 다시 요청하지 않아 LLM 비용이 들지 않습니다.
파일을 다른 위치로 복사한 사본이나 컨테이너만 바꾼 사본(mkv ↔ mp4)도 같은 오디오로 알아봅니다.

캐시 관리 — 설정에서 캐시 사용량을 확인하고 비울 수 있습니다. 작업 완료 화면에는 이번
실행이 번역을 얼마나 재사용했는지 표시됩니다.

웹 LLM 번역 모드 — API 키 없이도 번역할 수 있습니다. 에디터에서 프롬프트를 복사해
ChatGPT·Claude·Gemini 웹에 붙여넣고, 받은 결과를 앱에 다시 붙여넣으면 검증을 거쳐 자막
트랙으로 발행됩니다. 타이밍은 앱이 원본 기준으로 다시 붙이므로 모델이 시각을 바꿔도
어긋나지 않습니다.

오디오 추출 방식 선택 — 배경음이 큰 영상에서는 대사가 담긴 센터 채널만 뽑아 전사할 수
있습니다(5.1 등 센터 채널이 있는 소재에서). 작업 설정에서 고릅니다.

자막 품질 개선

  • 한 자막이 지나치게 길어지지 않도록 발화 사이의 빈 구간에서 나눕니다.
  • 한국어 번역에서 원문에 없는 호칭(선배·형·누나 등)을 만들어 붙이지 않습니다.
  • 노래 가사로 보이는 줄에는 를 붙입니다.
  • 언어 선택 입력의 키보드·스크린리더 접근성을 고쳤습니다.

설치

플랫폼별 파일과 자동 업데이트 동작은 저장소 README를 참고하세요. 이 빌드는 코드 서명이 없어
Windows에서는 경고가 뜨고 macOS는 아직 지원하지 않습니다.

v0.3.0

Choose a tag to compare

@lchata372-afk lchata372-afk released this 17 Aug 12:23
docs: 설치·자동 업데이트·라이선스 안내 README (subtle v2-25)