-
Notifications
You must be signed in to change notification settings - Fork 0
Japanese AI Models and Hardware
Voice2Winは3種類のモデル作業を分けています。それぞれの違いを理解することで、人工知能(AI)モデルやハードウェアの設定がずっと簡単になります。
| ワークロード | 目的 | 技術 |
|---|---|---|
| メインの文字起こし | 通常のディクテーション、音声コマンド、ブロック文字起こし、再文字起こし | WhisperまたはParakeet |
| ストリーム文字起こし | 録音中の非常に初期の中間結果 | 別のSherpa-ONNXオンラインモデル |
| AI強化 | テキストを修正または変換 | 内蔵Gemmaモデル、Ollama、LM Studio、または共有のVoice2Winインスタンス |
Parakeetはメインの文字起こしエンジンであり、ストリームモデルではありません。
OpenAI Whisperは、多くの言語にわたって非常に優れたオフライン認識を提供します。Parakeetよりも多くのリソースを使用し、通常は遅くなります。大規模モデルやリアルタイムブロック書き起こしには、グラフィックスカードのアクセラレーションが推奨されます。
NVIDIA Parakeet V3はより効率的で、メインプロセッサでのパフォーマンスも優れています。Whisperよりも誤りが若干多い場合があり、サポートする言語セットは少なめです。最大限の多言語対応よりも速度と低リソース使用が重要な場合に選択してください。
AIモデルの設定では、選択されたエンジンに属するモデルのみが表示されます。モデルファイルをダウンロードまたは削除するにはモデル管理を使用してください。メインウィンドウの現在のモデルリストから、ダウンロード済みモデルを選択できます。
メインプロセッサ(CPU)/グラフィックスカード(GPU)およびAIモデル割り当てテーブルは、オーディオ書き起こしとAI強化を独立して割り当てます。
- メインプロセッサ(CPU) は最も互換性の高い選択肢ですが、速度が遅くなる可能性があります。
- グラフィックスカード(GPU) はサポートされている作業負荷を加速し、選択した作業負荷が遅くなる可能性がある場合や十分なグラフィックスメモリが不足している場合にパフォーマンス警告を表示します。
- Ollama または LM Studio はローカルサーバーからAI強化を提供できます。ホストとポートを入力し、必要に応じてローカルのIPバージョン4(IPv4)ネットワークを検索し、モデルリストを更新して、報告されたモデルを選択します。
- Shared Voice2Win インスタンス は、別のコンピュータからオーディオ書き起こし、AI強化、またはその両方を提供できます。
ランタイムを変更すると、影響を受けたモデルがバックグラウンドで再読み込みされ、時間がかかる場合があります。
- Whisperおよび組み込みAI強化は、WindowsおよびLinuxでVulkanグラフィックスアクセラレーションを使用します。macOSはネイティブのグラフィックスパスを使用します。
- ParakeetおよびWindowsのストリーム文字起こしは、グラフィックスアクセラレーションにDirectMLを使用します。
- メインプロセッサはバックアップとして常に利用可能です。
Voice2Winは、パッケージサイズのためCUDAランタイムをバンドルすることを意図的に避けています。CUDAを別途インストールするよりも、VulkanまたはDirectMLをサポートする最新のグラフィックスドライバがより重要です。
音声およびAIモデルは同時に常駐可能です。両者の合計メモリ要件が重要です:
- 専用のグラフィックスメモリが不足している場合は、より小さなモデルやより強く量子化されたモデルを選択してください。
- 1つのワークロードをメインプロセッサに、もう1つをグラフィックスカードに割り当ててください。
- 警告推定値が利用可能なシステムまたはグラフィックスメモリを超えるモデルを読み込むことは避けてください。重度のページングにより、コンピュータ全体が応答しなくなる可能性があります。
- メモリではなくディスク容量が制限である場合は、代替のAIモデルストレージ場所を使用してください。
Ollamaのデフォルトポートは11434、LM Studioのデフォルトポートは1234です。Voice2Winは選択したサーバーのモデルリストを照会し、強化プロンプトをその設定済みサーバーにのみ送信します。サーバーの可用性、プライバシー、およびモデルの動作は、そのサーバーのインストール側の責任です。
1台のVoice2Winコンピュータは、現在読み込まれている音声およびAIモデルを他のVoice2Winインスタンスに公開できます:
- 設定 → AIモデル でランタイム共有を有効にします。
- ポートを選択し、必要に応じてパスワードを設定します。
- 他のコンピュータで、共有されたVoice2Winインスタンスを追加し、そのコンピュータ名またはIPv4アドレス、ポート、パスワードを入力するか、ローカルネットワークを検索します。
- リモート行にオーディオ文字起こしおよび/またはAI強化を割り当てます。
接続されているクライアントと最終使用情報は、共有コンピュータに表示されます。バージョンを揃えておいてください。バージョンの不一致は互換性の問題を引き起こす可能性があります。共有ランタイムを消費しているインスタンスは、そのランタイムを他に共有できません。
この機能は、設定されたネットワーク接続を通じてワークロードデータを送信します。他のユーザーがポートにアクセスできる場合は、信頼できるネットワークとパスワードを使用してください。
Languages
English
Deutsch
Español
Français
Português (Brasil)
Italiano
Nederlands
Polski
Svenska
简体中文
日本語
한국어
हिन्दी
繁體中文
Bahasa Indonesia
Tiếng Việt
- Chuyển Giọng Nói Thành Văn Bản
- Chuyển Văn Bản Thời Gian Thực
- Tăng cường AI
- Lệnh Giọng Nói
- Ghi âm Cuộc trò chuyện
- Điều Khiển Từ Xa Thiết Bị Di Động