指南
图像和声音
交互式语音模式、语音听写、大声朗读和生成图像创建。
9xchat 将多模式功能带入您的工作空间:实时语音对话、即时语音听写、朗读语音和专用图像生成。
图像游乐场和麦克风听写需要 Pro。 语音模式和大声朗读适用于所有帐户。请参阅 积分、Pro 和用法 。
互动语音模式
语音模式将 9xchat 变成自然的对话语音助手。您无需打字和等待,而是自然地说话,助理会实时回复。
语音码头
当从作曲家激活时,一个浮动的 Voice Dock 会出现在您的聊天线程上方:
- 非模态: 对话保持可见、可读和可滚动 码头后面。
- 波形可视化: 实时音频条显示麦克风电平和 助理语音输出。
- 语音活动检测 (VAD): 9xchat 监听您何时开始和停止 也就是说,无需手动按钮即可无缝管理轮流。
- **打断/打断:**您可以随时简单地打断助手 通过说话或点击球体。
- 线程同步: 每个语音回合都被转录成真实消息 在线程中,保持完整的对话历史记录完整。
语音配置
在设置→常规中,您可以配置:
- 语音聊天语言: 选择您的口语语言。
- TTS 语音配置文件: 从自然语音选项中选择助理的语气。
- 转录提供程序:选择123sudo或OpenAI 进行音频 转录。
语音听写
在任何您可以输入的地方——聊天编辑器、图像提示或注释——您都可以听写:
- 单击 麦克风 图标或使用听写快捷方式。
- 说出你的指示或想法。
- 单击“停止并转录”。 9xchat 将音频转换为结构化 Markdown 您的输入字段已准备好供您查看和发送。
大声朗读(TTS)
聊天中的每个 AI 响应都包含 大声朗读 操作:
- 免提聆听长答案、代码解释或摘要。
- 响应流式传输到音频中,以便以最小的延迟开始播放。
- 音频片段在本地缓存,以实现平滑的重复播放。
指向图像的一部分
单击您附加的图像将其打开,其上方有两个操作:裁剪和突出显示。两者都通过在图片上拖动一个框来工作;他们对那个盒子所做的事情是不同的。
裁剪 将图像裁剪为方框。当框架的其余部分确实不相关时(例如,带有三个不相关面板的屏幕截图),请使用它。
突出显示保留整个框架并标记框,使框外的所有内容变暗并绘制红色边框。当重点是“看这里”而不是“仅此”时使用它。裁剪按钮会丢失其周围的屏幕,而周围的上下文通常使问题变得可以回答。
突出显示还会在消息中写入一条线,指向标记区域,并且该线正在做实际工作:刻在图片中的标记仅在单词引用它时引导模型。保留该句子,或重写它以说明您希望对该地区执行的操作。
这两个操作都不会更改您附加的文件。两者都会生成一个新副本并附加它,因此如果您想尝试另一个,原始副本仍然可用。
图像游乐场
Images 是一个专门用于生成图像模型的工作室(包括 Seedream、DALL-E、Flux 等)。
- 在侧边栏中打开图像,然后选择新图像。
- 描述您的场景、风格、灯光和构图。
- 从提示框下方的下拉列表中选择您的图像模型。
- 生成的图像出现在您的图库历史记录中,您可以在其中下载、复制、 或检查生成参数。

您还可以使用生成图像工具直接在聊天中生成图像。
计费和隐私
- 云图像模型和转录从您的 9xchat 信用余额中提取或 您配置的 API 密钥。
- 音频隐私: 音频听写和语音合成需要网络处理 通过您选择的提供商(123sudo或OpenAI)。即使您的聊天模式设置为本地,音频也会离开您的计算机。请参阅 隐私和数据流。