映像と音声
インタラクティブ音声モード、音声ディクテーション、読み上げ、生成画像作成。
9xchat は、リアルタイムの音声会話、インスタント音声ディクテーション、音声読み上げ、専用画像生成などのマルチモーダル機能をワークスペースにもたらします。
画像プレイグラウンドとマイクディクテーションには Pro が必要です。 音声モードと読み上げ はすべてのアカウントで利用できます。 クレジット、プロ、および使用状況を参照してください。
インタラクティブボイスモード
音声モードでは、9xchat が自然な会話型音声アシスタントに変わります。入力して待つのではなく、自然に話すとアシスタントがリアルタイムで応答します。
ボイスドック
コンポーザーからアクティブ化すると、チャット スレッドの上にフローティング Voice Dock が表示されます。
- 非モーダル: 会話は引き続き表示、読み取り、スクロール可能です ドックの後ろ。
- 波形の視覚化: リアルタイムのオーディオ バーにはマイクのレベルと アシスタントの音声出力。
- 音声アクティビティ検出 (VAD): 9xchat は、開始時と停止時をリッスンします。 つまり、手動ボタンを必要とせずに順番をシームレスに管理できます。
- 割り込み/割り込み: いつでも簡単にアシスタントに割り込むことができます。 話すかオーブをクリックすることで。
- スレッド同期: すべての発話が実際のメッセージに転写されます スレッド内では、完全な会話履歴がそのまま維持されます。
音声設定
[設定] → [一般] で、以下を設定できます。
- ボイスチャット言語: 話し言葉を選択します。
- TTS 音声プロファイル: アシスタントのトーンの自然音声オプションから選択します。
- 文字起こしプロバイダー:音声に対して123sudoまたはOpenAI を選択します 転写。
音声ディクテーション
チャット コンポーザー、画像プロンプト、メモなど、入力できる場所であればどこでも、代わりに ディクテーション することができます。
- マイク アイコンをクリックするか、ディクテーション ショートカットを使用します。
- 指示や考えを話します。
- 停止して文字起こし をクリックします。 9xchat は、オーディオを構造化されたマークダウンに変換します。 入力フィールドが表示され、確認して送信できるようになります。
読み上げ(TTS)
チャット内のすべての AI 応答には、読み上げ アクションが含まれます。
- 長い回答、コードの説明、要約をハンズフリーで聞くことができます。
- 応答はオーディオにストリーミングされるため、最小限の遅延で再生が開始されます。
- オーディオセグメントはローカルにキャッシュされ、スムーズに繰り返し再生されます。
画像の一部をポイントする
添付した画像をクリックして開くと、その上に クロップとハイライト という 2 つのアクションが表示されます。どちらも、画像上でボックスをドラッグすることで機能します。その箱をどうするかが違いだ。
クロップ は、画像をボックスまで切り取ります。フレームの残りの部分がまったく無関係な場合、たとえば無関係なパネルが 3 つあるスクリーンショットなどの場合に使用します。
ハイライト はフレーム全体を保持し、代わりにボックスをマークし、その外側のすべてを薄暗くして赤い境界線を描きます。 「ここだけ」ではなく「ここを見て」という場合に使います。ボタンをトリミングすると、その周囲の画面が失われ、多くの場合、周囲のコンテキストによって質問の答えが決まります。
また、Highlight は、マークされた領域を指す行をメッセージに書き込みます。この行が実際の作業を行っています。画像に焼き付けられたマークは、単語がモデルを参照している場合にのみモデルを操作します。文をそのままにするか、その地域に対して何をしたいのかを書き直してください。
どちらの操作を行っても、添付したファイルは変更されません。どちらも新しいコピーを作成し、代わりにそれを添付するため、もう一方を試したい場合でも、オリジナルは利用可能なままになります。
イメージプレイグラウンド
Images は、生成画像モデル (Seedream、DALL-E、Flux などを含む) 専用のスタジオです。
- サイドバーで 画像 を開き、新しい画像 を選択します。
- シーン、スタイル、照明、構成について説明します。
- プロンプト ボックスの下のドロップダウンからイメージ モデルを選択します。
- 生成された画像はギャラリー履歴に表示され、ダウンロード、コピー、 または生成パラメータを検査します。

画像生成 ツールを使用して、チャット内で直接画像を生成することもできます。
請求とプライバシー
- クラウド イメージ モデルと転写は、9xchat クレジット残高から取得されます。または 設定された API キー。
- 音声プライバシー: 音声ディクテーションと音声合成にはネットワーク処理が必要です 選択したプロバイダー (123sudoまたはOpenAI) を通じて。チャット モデルがローカルに設定されている場合でも、音声はマシンから送信されます。 「プライバシーとデータ フロー」「」を参照してください。