Skip to content

v2.63.0

Latest

Choose a tag to compare

@tegnike tegnike released this 29 Jul 11:04
3b05653

新機能

  • 音声入力設定に「OpenAI 発話中文字起こし」を追加しました。
  • gpt-live-transcribe とWebRTCを使用し、発話中の部分的な文字起こし表示と、設定した無音時間後の自動送信に対応しました。
  • ブラウザ標準・録音後文字起こし・発話中文字起こしの3方式をユーザー目線の選択肢として整理しました。

改善

  • OpenAIの録音後文字起こしのデフォルトモデルを gpt-transcribe に更新し、話者識別モデルや固定スナップショットを含む現行モデルを選択できるようにしました。
  • Realtime APIの対応モデルを gpt-realtime-2.1 / gpt-realtime-2.1-mini に更新しました。
  • OpenAIライブ文字起こしでも、音声認識タイムアウト、無音検出タイムアウト、無音プログレスバーを利用できるようにしました。
  • クライアントシークレット取得とマイク取得を並列化し、接続開始までの待ち時間を短縮しました。

バグ修正

  • 文字起こしセッションのクライアントシークレット作成時に未対応の session.model を送信してエラーになる問題を修正しました。
  • 音声入力モード間の排他制御と設定マイグレーションを更新し、古い設定値から安全に移行できるようにしました。

ドキュメント・翻訳

  • 音声入力設定、Realtime API設定、環境変数のドキュメントを日本語・英語・中国語で更新しました。
  • 録音後文字起こしと発話中文字起こし、Realtime APIモードの役割の違いを明記しました。