Skip to content

Japanese AI Models and Hardware

Dan edited this page Aug 21, 2026 · 1 revision

AIモデルとハードウェア

Voice2Winは3種類のモデル作業を分けています。それぞれの違いを理解することで、人工知能(AI)モデルやハードウェアの設定がずっと簡単になります。

ワークロード 目的 技術
メインの文字起こし 通常のディクテーション、音声コマンド、ブロック文字起こし、再文字起こし WhisperまたはParakeet
ストリーム文字起こし 録音中の非常に初期の中間結果 別のSherpa-ONNXオンラインモデル
AI強化 テキストを修正または変換 内蔵Gemmaモデル、Ollama、LM Studio、または共有のVoice2Winインスタンス

Parakeetはメインの文字起こしエンジンであり、ストリームモデルではありません。

WhisperまたはParakeet

Whisper

OpenAI Whisperは、多くの言語にわたって非常に優れたオフライン認識を提供します。Parakeetよりも多くのリソースを使用し、通常は遅くなります。大規模モデルやリアルタイムブロック書き起こしには、グラフィックスカードのアクセラレーションが推奨されます。

Parakeet

NVIDIA Parakeet V3はより効率的で、メインプロセッサでのパフォーマンスも優れています。Whisperよりも誤りが若干多い場合があり、サポートする言語セットは少なめです。最大限の多言語対応よりも速度と低リソース使用が重要な場合に選択してください。

AIモデルの設定では、選択されたエンジンに属するモデルのみが表示されます。モデルファイルをダウンロードまたは削除するにはモデル管理を使用してください。メインウィンドウの現在のモデルリストから、ダウンロード済みモデルを選択できます。

実行時の割り当て

メインプロセッサ(CPU)/グラフィックスカード(GPU)およびAIモデル割り当てテーブルは、オーディオ書き起こしとAI強化を独立して割り当てます。

  • メインプロセッサ(CPU) は最も互換性の高い選択肢ですが、速度が遅くなる可能性があります。
  • グラフィックスカード(GPU) はサポートされている作業負荷を加速し、選択した作業負荷が遅くなる可能性がある場合や十分なグラフィックスメモリが不足している場合にパフォーマンス警告を表示します。
  • Ollama または LM Studio はローカルサーバーからAI強化を提供できます。ホストとポートを入力し、必要に応じてローカルのIPバージョン4(IPv4)ネットワークを検索し、モデルリストを更新して、報告されたモデルを選択します。
  • Shared Voice2Win インスタンス は、別のコンピュータからオーディオ書き起こし、AI強化、またはその両方を提供できます。

ランタイムを変更すると、影響を受けたモデルがバックグラウンドで再読み込みされ、時間がかかる場合があります。

プラットフォームによる加速

  • Whisperおよび組み込みAI強化は、WindowsおよびLinuxでVulkanグラフィックスアクセラレーションを使用します。macOSはネイティブのグラフィックスパスを使用します。
  • ParakeetおよびWindowsのストリーム文字起こしは、グラフィックスアクセラレーションにDirectMLを使用します。
  • メインプロセッサはバックアップとして常に利用可能です。

Voice2Winは、パッケージサイズのためCUDAランタイムをバンドルすることを意図的に避けています。CUDAを別途インストールするよりも、VulkanまたはDirectMLをサポートする最新のグラフィックスドライバがより重要です。

メモリ計画

音声およびAIモデルは同時に常駐可能です。両者の合計メモリ要件が重要です:

  • 専用のグラフィックスメモリが不足している場合は、より小さなモデルやより強く量子化されたモデルを選択してください。
  • 1つのワークロードをメインプロセッサに、もう1つをグラフィックスカードに割り当ててください。
  • 警告推定値が利用可能なシステムまたはグラフィックスメモリを超えるモデルを読み込むことは避けてください。重度のページングにより、コンピュータ全体が応答しなくなる可能性があります。
  • メモリではなくディスク容量が制限である場合は、代替のAIモデルストレージ場所を使用してください。

外部AIサーバー

Ollamaのデフォルトポートは11434、LM Studioのデフォルトポートは1234です。Voice2Winは選択したサーバーのモデルリストを照会し、強化プロンプトをその設定済みサーバーにのみ送信します。サーバーの可用性、プライバシー、およびモデルの動作は、そのサーバーのインストール側の責任です。

Voice2Winランタイムの共有

1台のVoice2Winコンピュータは、現在読み込まれている音声およびAIモデルを他のVoice2Winインスタンスに公開できます:

  1. 設定 → AIモデル でランタイム共有を有効にします。
  2. ポートを選択し、必要に応じてパスワードを設定します。
  3. 他のコンピュータで、共有されたVoice2Winインスタンスを追加し、そのコンピュータ名またはIPv4アドレス、ポート、パスワードを入力するか、ローカルネットワークを検索します。
  4. リモート行にオーディオ文字起こしおよび/またはAI強化を割り当てます。

接続されているクライアントと最終使用情報は、共有コンピュータに表示されます。バージョンを揃えておいてください。バージョンの不一致は互換性の問題を引き起こす可能性があります。共有ランタイムを消費しているインスタンスは、そのランタイムを他に共有できません。

この機能は、設定されたネットワーク接続を通じてワークロードデータを送信します。他のユーザーがポートにアクセスできる場合は、信頼できるネットワークとパスワードを使用してください。

Languages
English

Features

Configuration

Help

Deutsch

Funktionen

Konfiguration

Hilfe

Español

Funciones

Configuración

Ayuda

Français

Fonctionnalités

Configuration

Aide

Português (Brasil)

Recursos

Configuração

Ajuda

Italiano

Funzionalità

Configurazione

Aiuto

Nederlands

Functies

Configuratie

Help

Polski

Funkcje

Konfiguracja

Pomoc

Svenska

Funktioner

Konfiguration

Hjälp

简体中文

功能

配置

帮助

日本語

機能

設定

ヘルプ

한국어

기능

구성

도움말

हिन्दी

सुविधाएँ

कॉन्फ़िगरेशन

सहायता

繁體中文

功能

設定

說明

Bahasa Indonesia

Fitur

Konfigurasi

Bantuan

Tiếng Việt

Tính năng

Cấu hình

Trợ giúp

ไทย

คุณสมบัติ

การกำหนดค่า

วิธีใช้

العربية

الميزات

الإعداد

المساعدة

Türkçe

Özellikler

Yapılandırma

Yardım

Русский

Возможности

Настройка

Справка

Українська

Функції

Налаштування

Довідка

Clone this wiki locally