Skip to content

Evaluation

284_vd0w0bv edited this page Jun 30, 2026 · 17 revisions

評価と品質指標

このページは、本ソフトの導入で字幕作成業務がどう変わるか、そのうえで生成される字幕がどの程度の品質かを、集計値で説明します。

評価は次の4つの問いに分けて報告します。

問い データ
1. 導入によって字幕作成業務がどう変わるか 担当者ヒアリングに基づく工程と作業時間の比較
2. 実際の納品品質はどの程度か 納品済み講義の実作業コーパス分析
3. 新規に実行し直したとき、結果はどれだけ再現するか 同一入力での複数回実行(9ラン)
4. モデルを替えると何が変わるか 同一入力でのモデル別比較

1. 導入で字幕作成業務がどう変わったか

システム導入により、字幕作成の業務フローが次のように変化しました。

導入前(分断されたフロー)

文字起こし、英訳、字幕調整などを複数の担当者・ツールで処理しており、工程間の受け渡しが発生していました。

導入後(一貫したフロー)

AIによる文字起こし・機械翻訳の後、翻訳担当者が翻訳修正から字幕編集、SRT出力までを一つのアプリで一貫して担当できるようになりました。

定量的な効果

講義回ごとの作業時間差を考慮し、各担当者の想定作業時間をヒアリングして導入前後を比較しました。

導入前

工程 担当 想定時間
文字起こし クリエイティブ担当 0.25時間
日本語校正 翻訳担当 5.00時間
英語仮訳 LLM 0.50時間
翻訳修正 翻訳担当 18.00時間
SRT作成・CPS調整・字幕構成 クリエイティブ担当 3.00時間
最終チェック QC担当 3.50時間
合計 30.25時間

導入後

工程 担当 想定時間
文字起こし・日本語校正・英語仮訳 システム 0.30時間
翻訳修正・CPS調整 翻訳担当 20.00時間
SRT作成 翻訳担当 0.50時間
CPS調整 クリエイティブ担当 0.67時間
字幕構成 クリエイティブ担当 0.50時間
最終チェック QC担当 3.50時間
合計 25.47時間

導入後のCPS調整には、字幕区切り修正に相当する作業を含みます。

その結果、2時間講義1本あたりの総所要時間は、30.25時間から25.47時間へ、4.78時間(15.8%)短縮される試算となりました。

システム処理費用の目安

2時間の講義動画1本を処理した場合の平均費用です。費用は米ドルで示します。

費用項目 平均費用 単位
AI API $1.69 2時間講義1本あたり
AWS従量費 $0.064 2時間講義1本あたり
辞書生成API $0.81 PDF 1件あたり
AWS固定費 $0.125 1日あたり

費用の算出条件

AI API費用は、AIプロバイダにOpenAIを選択し、本ソフトのデフォルト設定(gpt-5.4-mini / gpt-5.4-nano)で処理した場合の、2時間講義1本あたりの実運用平均です。

翻訳や補正には主にmini、分割判定や軽量な短縮処理にはnanoを使用しています。辞書生成API費用は、講義資料PDFから専門用語や数式を抽出した場合の、PDF 1件あたりの平均です。

AWS従量費は、WhisperXの文字起こしを実行するAWS BatchのGPU処理(g4dn.xlarge)と、ジョブの登録、状態確認、結果取得を担うLambdaの実行費用を中心に算出しています。

AI APIとAWS従量費を合わせた動画処理の直接費用は、2時間講義1本あたり平均約$1.75です。辞書生成費とAWS固定費は利用方法に応じて別途発生します。

時間短縮による人件費削減を踏まえると、APIやAWS等のシステム運用費を含めても、導入効果が費用を上回る見通しです。

定性的な効果

工程の一貫化により、翻訳意図や文脈を保ちながら、CPS、文字数、改行などの字幕制約へ調整しやすくなりました。担当者からも、翻訳品質と字幕の見やすさが向上したとの評価が得られています。

作業時間は担当者ヒアリングに基づく想定値です。処理費用は測定時の平均値であり、動画の長さ、使用モデル、処理回数、AWS構成によって変動します。


2. 実際の字幕品質

本節では、本アプリを使って字幕を作成・納品した機械学習関連の講義3本(以下、講義A・講義B・講義C)を対象に、字幕品質を評価します。人が最終的に採用して納品した字幕を、以降「納品字幕」と呼びます。

翻訳の意味的な近さはCOMETで測定しました。原文、機械翻訳、参照訳(ここでは納品字幕)を入力し、参照訳との意味の近さを0〜1で推定します。1に近いほど意味が近いことを示します。

COMETは字幕の読みやすさ、区切り、表示時間を測りません。これらは形式指標で別に確認します。使用モデルは Unbabel/wmt22-comet-da です。

スコアの読み方

COMETの絶対値には普遍的な合否ラインがないため、このデータセットでは次の3点を基準にします(講義Aで測定)。

基準点 COMET mean 意味
上限(納品字幕を比較対象と参照訳の両方に使用) 0.953 この比較構成で出せる実質的な満点
納品時の機械翻訳(本ソフトの当時の出力) 0.919 納品字幕はこの出力を人が編集して作ったため、表現が似やすくスコアが高めに出る
新規に独立再生成した出力(後述) 0.835〜0.846 納品字幕の作成元ではないため、同じ意味でも言い回しが異なるとスコアが下がる

上限0.95から納品時出力0.919までの差約0.03が、人間の編集で意味的に動いた距離です。独立再生成との差には同じ意味の別表現も含まれるため、0.919とは直接比較できません。

実際の納品作業で何が起きたか

本アプリの機械翻訳出力(仮の字幕)を人が編集し、納品字幕として採用した講義A・講義Bについて、「日本語原文 → 機械翻訳 → 納品字幕」の3点を突き合わせました(対応単位1,016件)。

機械翻訳と納品字幕の近さ

指標 値
COMET平均(機械翻訳 vs 納品字幕、1,014件) 0.919
COMET 0.80未満 29件(2.9%)
対応タイプ: そのまま1対1 606件
対応タイプ: 1つを複数字幕へ分割 315件
対応タイプ: 複雑な再構成 87件

COMET低スコア事例の翻訳者レビュー(15件)

COMETスコアが低い順の上位事例を中心とする15件について、実際に納品を担当した翻訳者が機械翻訳と納品字幕を比較し、「なぜ編集したか」を確認しました。理由の内訳は次の通りです。

編集理由 件数 内容
内容変化なし 4 情報の順序や区切りの違いのみで、意味に変化はない
表現の改善 3 より簡潔・自然な字幕表現への言い換え
指示の明確化 2 字幕だけで視聴する人のために、指示対象や対応関係を明示
削除・簡略化 2 原文にない情報の削除や、冗長な説明の簡略化
コード対応 2 画面上のコードの変数名・クラス名表記に合わせる調整
構造の整理 2 説明の順序や論理関係が分かりやすくなるよう整理

人間の編集は何に使われたか

講義A・講義Bについて、機械翻訳の字幕単位が納品時にどのように編集されたかを分析しました。機械翻訳と納品字幕をタイムコードの重なりに基づいて1,016の比較単位に対応付け、字幕の分割・統合、短縮、境界調整などの変化を集計しています。

1,016件のうち、560件で少なくとも1つの変化が検出され、456件は今回の集計条件に該当する変化がありませんでした。1つの比較単位に複数の変化が含まれる場合があるため、分類件数は延べ710件です。

検出された変化 件数 内容
意味単位の分割 315 機械翻訳の単位を、読みやすい複数の字幕へ分割
短縮して完結した字幕単位へ 260 意味を保ちながら、短く完結した字幕表現へ編集
複雑な切り直し 54 単純な分割・統合では表せない形に再構成
本文構造を保った境界調整 33 本文構造を大きく変えず、字幕境界やタイミングを調整
原文の続き目を字幕内に吸収 22 原文途中の切れ目を、自然な字幕単位へ統合
断片を完結文に補修・統合 8 断片的な機械翻訳を、完結した字幕へ編集
短い境界の統合 7 複数の短い単位を1つの字幕へ統合
改行位置の再調整 6 読みやすさに合わせて改行位置を変更
機能語終わりの境界修正 4 前置詞や冠詞などで終わる境界を修正
納品字幕にのみ存在 1 対応する機械翻訳がなく、納品字幕だけに存在

納品字幕のCPS(1秒あたり文字数)中央値は9前後で、パイプラインの上限基準である17を下回っていました。

この編集結果を設定改善へ利用した例は、納品字幕をもとに分割設定を見直すを参照してください。


3. 新規に実行し直したら再現するか(9ラン再現性)

出力の再現性を測るため、講義A〜Cの修正済み書きおこしを固定入力にして、現行パイプラインをローカル小型モデル(gemma-4-e2b-it-qat)で各講義3回・計9ラン実行しました。

意味的近さのブレ

講義 COMET meanの範囲(3ラン) 標準偏差
講義A 0.8322〜0.8369 0.0024
講義B 0.7766〜0.7771 0.0003
講義C 0.7778〜0.7836 0.0032

形式順守率のブレ

ここでは、長すぎる字幕の目安としてCPS(1秒あたり文字数)20超の割合を見ています。

講義 cues/min 表示時間中央値 1秒未満cue率 CPS中央値 CPS>20率
講義A 8.2〜8.3 6.89〜6.92s 0% 9.3〜9.4 0.2〜0.4%
講義B 8.0 7.19〜7.22s 0% 10.8 0.3〜0.9%
講義C 11.6〜11.6 4.66〜4.68s 0% 11.3〜11.6 5.3〜7.0%

COMET meanの標準偏差は講義A・Bで0.003未満、講義Cでも0.004未満でした。形式指標もラン間で大きくは変わりません。講義Cのみ高CPSの字幕が5〜7%程度残っています。

低COMET(0.80未満)成分の構造分類(9ラン合計2,041件): 0.75〜0.80が約48%、0.65未満が約11%。長さの比較では「出力が納品字幕の1.4倍を超える長さ」が約37%、「納品字幕より大幅に短い」が約1%でした。

講義Cでの追加調査

講義Cについては、翻訳者から「聞き取りが難しく、専門用語が多い複雑な内容だった」という意見がありました。このため、講義Cで残った低COMET・高CPSの原因として、単純な誤訳だけでなく、専門的な説明を字幕向けにどこまで圧縮するかの難しさがあると考え、追加で設定調整を試しました。

ユーザーが設定画面で変更できる「冗長と判定する英日文字比(pipelineVerboseEnRatio)」を下げ、長い訳をより短縮対象にしやすくした場合の結果は次の通りです(講義Cの1ランで比較)。

条件 COMET mean 0.80未満 納品字幕比1.4倍超の低COMET CPS>20率
既定設定 0.7778 262 101 5.3%
pipelineVerboseEnRatio=1.4 0.7783 259 104 6.7%
pipelineVerboseEnRatio=1.35 0.7793 261 112 7.0%

COMET meanはわずかに上がりましたが、低COMET件数はほぼ変わらず、納品字幕より長い低COMETとCPS>20率は増えました。したがって、講義Cのような難条件では、単純に冗長判定を厳しくするだけでは十分ではありません。専門用語や条件説明を落とさず、かつ字幕として短くまとめるには、追加指示やfew-shot例で「何を残し、何を圧縮するか」を調整する必要があります。


4. モデルを替えると何が変わるか(同一入力比較)

講義Aの同一固定入力で、モデルだけを替えて比較しました。

モデル COMET mean 0.80未満 CPS>20率 実行時間 cues/min / CPS中央値
gemma-4-e2b-it-qat(ローカル・3ラン平均) 0.8341 25.7% 0.2〜0.4% 約9分 8.2 / 9.4
gpt-5.4-mini(クラウドAPI・1ラン) 0.8403 22.4% 0.4% 約4分 8.2 / 9.5
gemma-4-e4b-it-qat(ローカル・1ラン) 0.8464 19.3% 0.7% 約10分 8.2 / 9.6

講義B・講義CでもE2B→E4Bで同方向の改善を確認しています(mean +0.009〜+0.015、0.80未満率 -5〜-9ポイント)。

実行時間はローカルモデルがVRAM(計測機16GB)に収まる前提での値です。モデルがVRAMに収まらずCPUへオフロードされる構成では実行時間が数倍に伸びるため、ローカル運用では使用モデルが計測機のVRAMに収まるかを確認してください。

補足データ:

  • 形式指標(cues/min、CPS中央値、CPS違反率)はモデル間でほぼ同一でした(cue分割・表示時間・CPSはコード側で制御)
  • 同じ gpt-5.4-mini で入力だけを変えた比較: 修正済み書きおこし入力で0.840、音声認識から直接のフル実行で0.818(差0.022。E2B→E4Bのモデル差は+0.012)

再現手順

新規実行の評価はすべてローカルで再現できます(生成→COMET採点→形式指標→乖離分類)。

# 生成(LM Studioで対象モデルをロードしておく。クラウドは -Provider openai + 環境変数 OPENAI_API_KEY)
pwsh -File poc\t7_pipeline_evaluation\run_all_t7.ps1 -Model gemma-4-e2b-it-qat -OutputName current_head_e2b

# COMET採点(unbabel-comet入りvenvで実行)
python poc\t7_pipeline_evaluation\scripts\score_runs.py --runs all --output-name current_head_e2b --gpus 1

# 形式指標・乖離の構造分類
python poc\t7_pipeline_evaluation\scripts\design_metrics.py --output-name current_head_e2b
python poc\t7_pipeline_evaluation\scripts\lowcomet_structural.py --output-name current_head_e2b

実作業コーパス分析は poc/bilingual_analysis/ を参照してください。

制約

  • COMETは翻訳の忠実度を見る指標であり、字幕の読みやすさやレビュー工数を単独では表しません
  • 納品時の機械翻訳のCOMET 0.919は、納品字幕がその出力を人が編集して作ったものであるため、スコアの上振れを含みます。当時の本番構成と新規実行のモデルは異なるため、0.919と0.83台の差を「モデルの品質差」として読むこともできません
  • E4BとクラウドAPIは各1ランのみで、再現性の数値はE2Bのみで測定しています
  • 実行時間はモデルがVRAMに収まる構成での値です。VRAMを超えてCPUオフロードが発生すると数倍に伸びるため、ハードウェアに依存します
  • 音声認識込みフル実行の値(0.818)は入力条件が異なる参考値です
  • 公開版では、講義本文、字幕本文、個別の誤り例、授業内容が推測できる分類は掲載しません

Clone this wiki locally