分类
AI音频与语音
OpenClaw技能分类:AI音频与语音
资源列表
200 项- 音频笔记记录器 · 大模型 · 语音笔记助手:录音自动转文字并整理成结构化笔记,支持说话人识别,自动总结要点和行动项
- 语音用户界面 · 大模型 · 自我进化的语音助手界面。与您的 AI 对话,要求它自我改进,并实时观察代码更新。
- 可接入飞书的senseaudio角色扮演... · 大模型 · 飞书语音陪伴技能。当用户在飞书机器人会话中发送任何文字或语音消息时触发此技能。大模型根据用户自定义的虚拟角色人设,生成符合角色性格的文本回复,并通过 Sense...
- 百度AI Studio大语言模型API · 大模型 · 百度「AI Studio 星河社区」大模型 API 调用助手,帮助开发者快速接入大模型 API 服务,调用文心(ERNIE)、DeepSeek 等大模型能力。该...
- 审查模拟 · 大模型 · 进行中文求职语音模拟面试。适用于用户想围绕目标岗位进行多轮中文面试练习,并通过 ASR 识别回答、由 LLM 决定追问或换题、由 TTS 播报面试官问题,最终输...
- 语音交互技能-feishu&qq-byL... · 大模型 · 飞书语音交互技能。支持语音消息自动识别、AI 处理、语音回复全流程。需要配置 FEISHU_APP_ID 和 FEISHU_APP_SECRET 环境变量。使用...
- 趣味ASR Nano转录 · 大模型 · 使用 Fun-ASR-Nano-2512 轻量级模型进行语音转文字。提供快速准确的中文语音识别,识别结果实时输出到控制台,针对 CPU/GPU 环境优化。使用场...
- 个性化语音 · 大模型 · 在 chatgpt / claw 与飞书 / lark 机器人场景中,根据随机或指定人格生成明显带有人格风格的短回复,并通过 senseaudio tts 合成...
- 晓蜜智能外呼 · 大模型 · 该技能调用阿里云晓蜜外呼机器人,向指定手机号码列表发起自动语音外呼,支持自定义话术场景,可批量处理数十至数千个号码,并实时追踪外呼任务进度。当用户问题涉及“批量...
- 飞书语音聊天 · 大模型 · 飞书语音对话能力,提供语音识别(ASR)和语音合成(TTS)功能,所有的飞书语音消息都通过该技能处理。完整语音交互链路:接收用户语音 → ASR 转文字 → L...
- 李飞书音频 · 大模型 · 飞书语音交互技能。支持语音消息自动识别、AI 处理、语音回复全流程。需要配置 FEISHU_APP_ID 和 FEISHU_APP_SECRET 环境变量。使用...
- Byted 语音转文字 · 大模型 · 语音转文字(ASR)。使用火山引擎 BigModel ASR 识别语音,包含极速版(≤2h/100MB 同步快速返回)和标准版(≤5h 异步识别)两种模式。支持...
- 飞书语音发送器(TTS) Feishu语... · 大模型 · 飞书语音发送器 | Feishu Voice Sender 支持 TTS 语音合成,以及可选的 ASR 语音识别功能。当用户明确要求发送飞书语音消息时调用此工具...
- 飞书发送语音 · 大模型 · 将文本转换为语音,并通过飞书音频消息发送给指定用户。用于“给用户发语音”“把这段话转换为语音并发送飞书”“语音播报结果”等场景,尤其在普通文件发送会被降级为文本...
- 语音合成 · 大模型 · 使用 edge-tts 生成高质量中文语音消息并发送。当用户要求发语音、语音回复、TTS、文字转语音、语音播报、语音消息时使用。支持多种中文声音(男声/女声/方...
- 飞书 Edge TTS 语音 · 大模型 · 飞书语音消息发送技能。使用 Edge TTS(微软,免费无限次)生成语音并以飞书语音气泡形式发送。当用户要求用语音回复、发语音消息、TTS 朗读内容时触发。默认...
- feishu-voice-sender ... · 大模型 · 飞书语音消息发送器。基于 Edge TTS,一键将文字转为语音发送到飞书。使用场景: - 发送语音通知/提醒到飞书 - 文字转语音自动播报 触发词:飞书语音、语...
- 60秒 API 综合技能 · 大模型 · 60s API 综合技能,提供每日新闻、AI 资讯、热搜榜单、天气查询、数据查询、娱乐内容、媒体信息和实用工具。当用户询问新闻、热搜、天气、汇率、农历、笑话、运...
- 阿里云 AI 语音识别 · 大模型 · 使用阿里云 Model Studio Qwen ASR 模型(`qwen3-asr-flash`、`qwen-audio-asr`、`qwen3-asr-fla...
- Qwen3-TTS 飞书语音 · 大模型 · 使用 Qwen3-TTS 本地语音合成,将文字转为语音文件,并可通过飞书发送语音消息(语音气泡格式)。支持 Apple Silicon (MPS) 和 CUDA...
- 有趣的声音类型 · 大模型 · 一个语音输入法插件。它基于阿里云FunASR实时语音识别技术,允许用户通过长按快捷键(Right Option键)直接将语音转换为文字并“打”在当前光标所在的任...
- 阿里云 AI 语音合成 · 大模型 · 使用 Model Studio DashScope Qwen TTS 模型(qwen3-tts-flash、qwen3-tts-instruct-flash)生...
- 飞书语音技能 · 大模型 · 通过 Edge TTS 把文字转语音,发送到飞书。支持纯语音发送和文字语音同时发送。环境变量配置,无硬编码凭证,完全免费无需 API Key。触发词:飞书语音、...
- Qwen 语音合成 · 大模型 · 阿里云千问语音合成(TTS)技能,支持将文本转换为自然语音。当用户要求朗读、语音合成、文字转语音、TTS、读一段话、把文字转成声音时使用。支持多种音色(中文/英...
- 哔哩哔哩音频转写 · 大模型 · 从 Bilibili 或 b23.tv 链接下载音频,并使用 yt-dlp、ffmpeg 和 faster-whisper 将其转录为 txt、srt 和分段 ...
- volcengine-tts-feish... · 大模型 · 火山引擎豆包语音合成模型2.0 TTS。支持多种音色、情感参数、SSML标记,生成高质量中文语音,支持一键发送飞书语音气泡。使用HTTP单向流式API,稳定可靠...
- 飞书语音机器人 · 大模型 · 通过 Feishu 使用 edge-tts 和 ffmpeg 发送本地语音气泡。将文本转换为 OGG/Opus 音频,并作为可播放的蓝色语音气泡发送。使用场景:...
- 语音消息 · 大模型 · 使用 edge-tts 进行文本到语音转换,并使用 ffmpeg 处理音频,在聊天频道(Telegram、Discord、飞书/Lark、Signal、What...
- audioclaw-技能-语音回复 · 大模型 · 当 AudioClaw 技能、飞书或 Lark 需要发送具有运行时可切换的 voice_id、情感预设或语音风格的 AudioClaw 语音回复时使用,包括…
- OpenClaw TTS 语音切换 · 大模型 · 通过更新 ~/.openclaw/openclaw.json 切换 OpenClaw ElevenLabs TTS 语音,保持中文安全默认设置,并重启网关。
- Minimax Tts 中文 · 大模型 · MiniMax TTS 技能(增强版)。多代理语音支持(每个代理可以选择 SOUL.md 中编写的独特语音),Telegram 的原生语音消息(MP3)以及…
- 德牧洒洒·房车陪伴助手 · 大模型 · 洒洒(房车陪伴助手)。会说话的德牧导航官,是净如姐房车旅途的小狗搭档。唤醒口令「洒洒,洒洒」,可语音控制高德导航、邮件回复、百度/谷歌搜索、腾讯会议及常用App...
- 飞书语音技能 · 大模型 · 让 AI 助手能够给飞书用户发送真正的语音条(点击即播,不是文件附件)。支持 NoizAI TTS 生成语音,自动转换为 OPUS 格式,通过飞书 API 发送...
- 飞书语音(ElevenLabs) · 大模型 · 使用 ElevenLabs 的 TTS 和 STT 在飞书(Lark)上发送和接收语音消息。当用户请求在飞书上发送语音消息,或在接收语音消息时激活。
- 阿斯尔祷告时间 · 大模型 · 通过 Step ASR 流式 API(HTTP SSE)将音频文件转录为文本。支持中文和英文,多种音频格式(PCM、WAV、MP3、OGG/OPUS),实时.....
- 斗宝 ASR · 大模型 · 通过字节跳动/火山引擎的 Doubao Seed-ASR 2.0(豆包录音文件识别模型2.0)将录音文件转写为文本。业内顶级的中文语音识别,拥有优秀的语音...
- Edge TTS 儿童配音定制版 · 大模型 · Edge TTS 中文定制版 - 包含儿童配音预设。生成后自动发送到对话,无需翻文件。触发词:配音、TTS、文生音、语音、配音生成、儿童配音
- 阿里云 AI 音频 TTS 实时 · 大模型 · 使用阿里云 Model Studio Qwen TTS 实时模型进行实时语音合成。适用于需要低延迟交互式语音的场景,包括指导...
- 阿里云 AI 音频 TTS 语音设计 · 大模型 · 使用阿里云模型工作室 Qwen TTS VD 模型进行语音设计工作流程。在根据文本描述创建自定义合成语音并使用它们时使用。
- 飞书语音回复 · 大模型 · 通过合成文本生成飞书原生语音回复,并使用 ffmpeg 将其转换为 Ogg/Opus 格式,从而提供可播放的暂停/继续条,并以语音形式发送...
- 百联语音合成 · 大模型 · 通过 `bailian-cli` npm 包使用阿里云百炼 TTS 生成语音音频。用户请求将文本转换为语音、选择声音/语言、批量生成时使用...
- 智谱 AI 语音合成 · 大模型 · 使用 Zhipu AI(大模型)GLM-TTS 模型进行文本转语音转换。需要将文本转换为带有多种语音选项的音频文件时使用。支持中文...
- 村雨飞书语音 · 大模型 · 飞书语音气泡技能:使用丛雨(Murasame)语音包发送语音;若可表达则按标签发送语音并同步发送中文文本;支持开关控制、标签映射与关键词回退。
- 阿里云 AI 音频实时语音识别 · 大模型 · 当需要使用阿里云模型开发Studio Qwen ASR实时模型进行低延迟实时语音识别时使用,包括流式麦克风输入,li...
- 阿里云 AI 音频 TTS 语音克隆 · 大模型 · 使用阿里云模型工作室 Qwen TTS VC 模型的语音克隆工作流程。用于从示例音频创建克隆声音并进行文本合成...
- OpenClaw语音技能套装 · 大模型 · OpenClaw语音技能套装 - 完整的离线语音交互解决方案,支持6种中文方言(普通话、粤语、吴语、客家话、闽南话、四川话)
- 开爪-低声-ASR · 大模型 · 本地 Whisper 语音识别配置。自动将飞书/Telegram 等渠道的语音消息转换为文字。适用于需要离线、低延迟语音转文字的场景。
- 讯飞语音回复 · 大模型 · 语音回复技能 - 使用讯飞 TTS 生成语音并发送到飞书。当需要用语音回复用户消息时使用。触发词:用语音、语音回复、切换语音模式、语音模式。
- Edge TTS 中文 · 大模型 · 使用 node-edge-tts npm 包进行文本到语音的转换,以从文本生成音频。支持多种声音、语言、速度调节、音高控制...
- 智能语音多语言 TTS(Jaskies) · 大模型 · 将多语言文本(越南语-中文-英语)转换为准确的语音。自动处理拼音并拼接高质量音频。需要安装 edge-t...
- Fun-ASR 语音识别 · 大模型 · 阿里云百炼 FunASR 录音文件识别,使用阿里云 DashScope API 进行语音转文字。当用户需要转录音频文件时触发。
- 阿里云 AI 音频实时翻译 · 大模型 · 在需要使用阿里云模型工作室 Qwen LiveTranslate 模型进行实时语音翻译时使用,包括双语会议、实时口译、...
- 你好 TTS · 大模型 · 曼波音色 TTS 快速调用 - 活泼有活力的中文女声预设,基于 Edge TTS (zh-CN-XiaoyiNeural 音高 8%)
- 科兹 阿斯尔 · 大模型 · 使用 Coze API 的自动语音识别(ASR)。在需要将音频文件转录为文本时使用。通过 Coze 的语音识别支持中文音频转录...
- 飞书语音消息 · 大模型 · 将 TTS 音频作为可正常播放的音频消息(而非文件附件)发送到飞书聊天中。在被要求发送语音消息、TTS 音频、语音公告时使用...
- 飞书-edge-tts-win · 大模型 · 飞书语音消息发送技能(Windows 版)。使用 Edge TTS(微软,免费)生成语音并以飞书语音气泡发送。
- minimax-tts · 大模型 · 使用 MiniMax speech-2.8-hd 模型进行高质量文本到语音合成。支持多种中文和英文语音。需要时安装。
- 你好,亲爱的 · 大模型 · AI女友随机发送语音情话功能。支持定时发送情话到飞书和QQ,使用Noiz TTS进行声音克隆,自动管理情话库和时间间隔计算。
- 睡前故事生成器 · 大模型 · 一项睡眠与放松技能,通过WhatsApp、微信或飞信等发送AI生成的床边音频故事,并混合环境背景音乐,以语音消息的形式播放
- Qwen ASR(基于 C 的离线) · 大模型 · 离线中文和中英混合语音转文字识别,使用纯C实现,无需Python或FFmpeg依赖,适用于边缘设备。
- 智谱 ASR · 大模型 · 使用知谱AI(大模型)GLM-ASR模型进行自动语音识别(ASR)。在需要将音频文件转录为文本时使用。支持中文音频转...
- minimax_tts语音回应_飞书 · 大模型 · 使用 MiniMax API 将文本转换为语音,并在用户语音回复请求时在飞书上发送语音气泡消息。
- 智慧家长熊孩子 · 大模型 · 针对“聪明育儿问题儿童”的全方位人格技能,采用费曼风格的中文教学和创意编排声音。在 Codex 需要回答时使用...
- 中文语音合成 · 大模型 · 生成中文TTS音频并以飞书语音消息发送。当用户用中文询问语音/音频/语音/播报/朗读时,或通过飞书发送音频消息时使用。
- 飞书原生气泡生成 · 大模型 · 教飞书agent如何发送语音气泡消息。需要先将文字转语音(MP3),再转为opus格式,最后通过飞书消息工具发送。
- 飞书 Edge Tts · 大模型 · 使用微软 Edge TTS(免费)生成语音,发送到飞书。无需 API key,音质优秀,支持多语言多音色。
- 飞书语音克隆 TTS 技能 · 大模型 · 使用 Volcengine TTS 的预设或克隆语音将文本转换为语音,并向飞书聊天或群组发送音频消息。
- 语音识别 · 大模型 · 使用 OpenAI Whisper CLI 的本地语音转文字。支持中文、英文及 100 种语言,并提供翻译和摘要功能。
- MiniMax TTS 国内版 · 大模型 · 调用MiniMax语音合成API,支持中文多音色、高质量文本转语音,提供流式和非流式音频输出。
- Wecom 语音 · 大模型 · 使用 Windows TTS 向企业微信发送原生语音消息。将文本转换为语音并发送为语音消息(不是音频文件)。
- Funasr 转录技能 · 大模型 · 当用户需要对音频文件进行本地语音转文本转录时使用,尤其是中文或中英文混合的音频,而无需依赖云服务。
- 学而思单词故事记忆 · 大模型 · 学而思单词故事记忆:将英语词汇转化为生动的中文助记法、语音故事和视觉场景,帮助K-9学生快速记忆单词…
- Qwen Asr 技能 · 大模型 · 提供高精度语音转文字转换,支持22种中文方言和30种语言,具备自动语言检测功能,可在CPU上运行。
- 飞书语音回复 · 大模型 · 通过火山引擎 TTS 合成多音色语音,转换为 Opus 格式后,使用飞书 API 自动上传并发送语音消息。
- 腾讯语音播客 · 大模型 · 使用腾讯云TTS将文本转换为播客音频。支持短文本和长文本处理,可生成最长30分钟的音频,并自动分段...
- 飞书音频消息 · 大模型 · 通过飞书Open API发送语音消息,支持文本转语音和上传多格式音频文件,自动转换为opus格式发送。
- TTS 语音 AI · 大模型 · AI多语言文字转语音工具,支持中文、英文、日语、韩语、粤语语音生成、配音、有声书及语音克隆。
- 飞书语音消息 · 大模型 · 从文本生成飞书语音消息(带波形图)。自动转换为 OPUS 格式,可在移动端和桌面端的聊天中播放。
- 电子号角 · 大模型 · 将文本转换为飞书(Lark)语音消息。当代理需要在飞书群中发言、发送语音提醒或公告,或回复时使用。
- 飞书的 MiniMax TTS · 大模型 · MiniMax 文字转语音,支持中文音色、自动情绪检测、语气词音效和停顿标记
- 股票监控技能 · 大模型 · 自动监控股票价格,突破阈值时自动发送飞书语音提醒。支持多只股票、自定义阈值、交易时间判断。
- 百联 TTS · 大模型 · 百炼 TTS 语音合成,支持多种音色切换,生成高质量中文语音,需配置百炼 API Key。
- 飞书语音回复 · 大模型 · 飞书语音消息自动回复技能 - 使用 Edge TTS 生成语音并通过飞书 API 发送
- 飞书消息 · 大模型 · 统一的 CLI 工具包,用于飞书消息任务,包括获取消息、发送音频、创建群聊和列出置顶消息。
- 免费飞书语音 · 大模型 · 通过使用可配置的凭据和选项生成并上传 TTS 音频,将自定义语音消息发送到飞书聊天。
- 飞书音箱 · 大模型 · 飞书双向语音消息工具 - 支持语音转文字接收和文字转语音发送(TTS Whisper)
- 飞书语音识别 · 大模型 · 使用本地Whisper模型识别飞书语音消息。离线免费,不需要注册,不需要联网。
- 音频重命名 · 大模型 · 将带有中文/特殊字符的音频文件重命名为简单的英文名称,以兼容 mlx-stt。
- Qwen3 TTS 指令 · 大模型 · 阿里云百链 Qwen TTS 带有语音/情绪预设
- 飞书语音助手 · 大模型 · 使用 Duby TTS 向飞书聊天发送语音消息(音频)。
- 阿里云语音合成 · 大模型 · 阿里云文本转语音合成服务。
- tts-winmsg-免费 · 大模型 · Windows local TTS reading skill. It sends AI responses to a mini window for read...
- openai-tts-python · 大模型 · 使用 OpenAI 的 TTS API 进行文本到语音转换,以生成高质量、自然听感的音频。支持 6 种声音(alloy、echo、fable、onyx、nova...
- 将任务卸载到 LM Studio 模型 · 大模型 · 通过将工作转移到本地 LM Studio 模型,从而减少付费提供商的 token 使用。适用场景: (1) 降低成本——当质量足够时,使用本地模型进行摘要、提取...
- Azure OpenAI 代理 · 大模型 · 通过轻量级本地代理启用 Azure OpenAI 与 OpenClaw 的集成。在将 Azure OpenAI 配置为模型提供程序时、在 OpenClaw 中遇...
- ACE 音乐 - 免费 Suno 替代品... · 大模型 · 使用 ACE Music 的免费 API 通过 ACE-Step 1.5 生成 AI 音乐。当用户要求创建、生成或作曲音乐、歌曲、节拍、伴奏或...时使用。
- Qwen3-语音合成 · 大模型 · 使用 Qwen3-TTS-12Hz-1.7B-CustomVoice 进行本地文本转语音。可在从文本生成音频、创建语音消息或请求 TTS 时使用。支持包括意大利...
- Edge 语音合成 · 大模型 · 使用 node-edge-tts npm 包将文本转换为语音,用于从文本生成音频。支持多种声音、语言、语速调节、音高控制和字幕生成。适用场景: (1) 用户通过...
- 🗣️ 使用 uvx 的 Edge-TTS... · 大模型 · 使用 `uvx edge-tts` 进行文本到语音转换,以从文本生成音频。适用场景: (1) 用户使用“tts”触发词或关键字请求音频/语音输出。 (2...
- 语音克隆 TTS · 大模型 · 声纹克隆和语音合成。上传音频样本克隆声纹,用克隆声纹或预设声纹生成语音。支持多个后端:MiniMax、ElevenLabs、Fish Audio、Azure T...
- 语音 TTS/ASR · 大模型 · Voice input (Whisper ASR) and voice output (Edge TTS) skills, supporting agent-s...
- vwu.ai 语音合成模型 · 大模型 · Invoke the vwu.ai speech synthesis models speech-2.8-hd and speech-2.8-turbo, yo...
- 极小化极大演讲 · 大模型 · 使用 MiniMax API 将文字转换为 MP3 语音文件。触发词:文字转语音、TTS、生成语音、生成音频、把文字转成语音、文字转MP3、生成MP3。触发后按...
- 斗宝语音合成 · 大模型 · 使用豆包(火山引擎)语音合成大模型 API 将文本转换为语音音频文件。支持声音复刻音色(S_ 开头的音色ID)和官方预置音色。当用户要求“语音合成”、“文字转语...
- 小窗幽 · 大模型 · 新中式生活美学指南 AI 助手。当用户询问节气养生、茶道、咖啡、诗词文学、传统穿搭、手工非遗、园艺、摄影、器物美学、传统节俗、人文地理等生活方式话题时激活。触发...
- 每日复盘经理 · 大模型 · 每日复盘管理助手。用于接收、记录、整理用户的每日复盘内容。当用户说“复盘”、“今天感悟”、“流水账”、“帮我记录一下今天的复盘”、“每天提醒我复盘”、“做周报”...
- 小志MCP音乐官方 · 大模型 · 按小智官方 MCP 接入方式,为小智增加在线音乐播放能力。适用于已经有小智 MCP 接入点(wss://api.xiaozhi.me/mcp/?token=.....
- Ollama — 适用于 Mac Stu... · 大模型 · Ollama Ollama Herd —— 多模态模型路由器,将你的 Ollama LLMs 汇聚到一个智能端点。跨 Mac Studio 路由 Llama、Q...
- 语音助手 · 大模型 · 用于 OpenClaw 的实时语音助手。通过可配置的语音转文本(STT)(Deepgram 或 ElevenLabs)将麦克风音频流传输到您的 OpenClaw...
- 点击发送 · 大模型 · ClickSend API 与托管身份验证集成。发送短信、彩信和语音消息,管理联系人和列表。当用户想要发送短信、拨打语音电话、管理联系人列表或跟踪消息发送情况时...
- 播客下载器 · 大模型 · 小宇宙播客下载工具。从小宇宙(xiaoyuzhoufm.com)下载播客音频和节目笔记。自动转换为MP3格式(兼容Sanag、小宇等骨传导蓝牙耳机,水下游泳时离...
- 音频内容生成器 · 大模型 · 按需生成有声书、播客或教育音频内容。用户提供一个想法或主题,Claude AI 撰写剧本,ElevenLabs 将其转换为高质量音频。支持多种格式(有声书、播客...
- 芊云VR全景运营小助手 · 大模型 · 全景 VR 作品管理技能,覆盖账号登录配置(uid/token)、作品、素材、场景、热点、配乐、语音讲解、评分查询与接入指引。用户提出“配置登录信息”、“创建/...
- 本地语音(FluidAudio 语音合成... · 大模型 · 在 Apple Silicon 上使用 FluidAudio 进行本地文本到语音 (TTS) 和语音到文本 (STT)。通过 Apple 神经引擎完全在设备上运...
- SAM 语音合成 · 大模型 · 使用 SAM(软件自动语音口,Software Automatic Mouth),经典的 C64 文本转语音合成器,生成复古机器人语音音频。使用 /sam 命令...
- Qwen — Qwen3, Qwen3-... · 大模型 · Qwen Qwen3 — 在你的本地服务器上运行 Qwen3.5、Qwen3、Qwen3-Coder、Qwen2.5-Coder 和 Qwen3-ASR。大语言...
- 打开 WhatsApp 语音技能 · 大模型 · 实时 WhatsApp 语音消息处理。通过 Whisper 将语音笔记转录为文本,检测意图,执行处理程序,并发送响应。用于构建 WhatsApp 对话语音界面。...
- 极小极大音乐 · 大模型 · MiniMax 音乐生成技能 - 支持歌词生成(Lyrics Generation)、音乐生成(Music Generation)。支持自定义歌词段落结构(ve...
- 九马免费声音克隆 · 大模型 · 九马AI语音克隆技能。使用九马AI API进行语音克隆和合成,支持在线音色选择或自定义音频参考。当用户需要语音克隆、语音合成或选择不同音色时使用此技能。技能安装...
- 亚的斯助手 · 大模型 · 使用 Addis Assistant API(api.addisassistant.com)提供语音转文本(STT)和文本翻译功能。当用户需要将音频文件转换为文...
- IMA 人工智能音乐与语音生成器 — 歌... · 大模型 · 使用 Suno sonic v5、DouBao BGM 和 DouBao Song 的 AI 音乐生成器和语音生成器。生成 AI 音乐、带歌词的歌曲、背景音乐、...
- 说唱歌手 · 大模型 · 使用 `/v1/song/lyrics/create`、`/v1/song/lyrics/pending/:task_id`、`/v1/song/lyrics/...
- ElevenLabs 音乐 · 大模型 · 使用 ElevenLabs 的 Eleven Music API 根据文本提示生成音乐。在创作歌曲、配乐、广告歌曲、摇篮曲或任何音频音乐时使用。支持带 AI 生...
- 本地语音转文本 Qwen3-ASR 使用... · 大模型 · Windows 本地离线语音识别 — 无需云端,无需 API 费用,完全隐私。Qwen3-ASR 0.6B Intel OpenVINO,GPU 加速推理。...
- acestep-歌词转录 · 大模型 · 使用 OpenAI Whisper 或 ElevenLabs Scribe API 将音频转录为带时间戳的歌词。输出 LRC、SRT 或带单词级时间戳的 JSO...
- 会议助手 · 大模型 · 用于构建和排查 SenseAudio 会议助手,覆盖实时会议转写、说话人区分、实时翻译、会议纪要生成、行动项提取与转录导出。构建和排查 SenseAudio 会...
- Tomoviee 文本到音乐 · 大模型 · 通过 Wondershare OpenAPI 网关(`https://openapi.wondersh...`)使用 Tomoviee Text-to-Musi...
- GPU 集群管理器 — 用于 Mac S... · 大模型 · 将你的闲置 GPU 变成一个推理端点。自动发现网络上的机器,将请求路由到最可用的设备,学习你的 Mac 何时...
- qqbot-语音识别 · 大模型 · Run the Qwen3-ASR model locally, providing accurate speech-to-text functionality...
- Whisper GPU 音频转录器 · 大模型 · 使用 OpenAI Whisper 将音频转换为 SRT 字幕,并为 Intel XPU / NVIDIA CUDA / AMD ROCm / Apple Me...
- 小度控制 · 大模型 · 当用户要连接、验证、排障或控制小度智能屏 MCP 与小度 IoT MCP 时使用,包括配置 mcporter、列设备、文本播报、语音指令、拍照、资源推送,以及灯...
- Whisper Tailnet API · 大模型 · 通过 Tailnet 在 http://100.92.116.99:8765 使用共享的 Whisper 语音转文本 API,使用兼容 OpenAI 的音频转录...
- 语音记录 · 大模型 · 使用 Soniox 实时语音转文字功能为 OpenClaw 进行后台语音记录。需要 SONIOX_API_KEY。请在 https://soniox.com/s...
- 语音转文字 — Qwen ASR 在您的... · 大模型 · 使用 Qwen ASR 的语音转文本——本地转录可在您的 Apple Silicon 设备群中进行。转录会议、语音笔记、播客和音频文件,无需...
- Chanjing Tts · 大模型 · 使用 Chanjing TTS API 将文本转换为语音。主要凭证:credentials.json(app_id/secret_key;访问令牌已保存)。不是...
- ifly-hyper-tts · 大模型 · 讯飞超拟人语音合成 - 支持文本转语音、语音合成(发音人/语速/语调/音量/输出格式)。大模型语音合成技能。语音合成, 文字转语音, 超拟人, TTS. 用户指...
- WiiM · 大模型 · 控制 WiiM 音频设备(播放、暂停、停止、下一首、上一首、音量、静音、播放网址、预设)。当用户想要控制音乐播放、调整音量、发现网络上的 WiiM/LinkPl...
- Elevenlabs 语音合成 · 大模型 · ElevenLabs TTS —— 适用于 OpenClaw 的最佳 ElevenLabs集成。ElevenLabs带有情感音频标签的文本转语音,ElevenL...
- KittenTTS WhatsApp · 大模型 · 使用 KittenTTS 和 ffmpeg 的 WhatsApp 语音对语音模式。使用 Whisper 转录接收到的音频,并以转换为 WhatsApp 兼容格式...
- Lyrion 音乐 · 大模型 · 通过 JSON-RPC API 控制 Lyrion 音乐服务器 (LMS)。使用此技能进行播放控制(播放/暂停/停止)、音量、播放列表管理、播放器选择和音乐数据...
- SIP语音通话控制 · 大模型 · 使用 Telnyx Call Control API 的语音界面。通过 AI、函数调用和自然对话接听电话。可用于免提助手访问、电话提醒或语音控制工具。需要 No...
- LM Studio 迪斯科机器人 · 大模型 · 将本地 LM Studio 模型直接连接到 Discord,作为轻量级聊天机器人使用。当您想将本地 LLM(通过 LM Studio 在 CPU 上运行)暴露给...
- 作词人 · 大模型 · 歌词创作技能。根据给定的主题或情感,创作适合 Suno AI 音乐生成的英文歌词,包含 lyrics 和 styles 参数。触发条件:用户要求写歌词、创作歌词...
- ElevenLabs 语音转文字 Ope... · 大模型 · 使用 ElevenLabs 的语音转文字工具(Scribe v2)从本地命令行转录音频文件。支持说话人区分、事件、JSON 输出、网络钩子以及高级语音转文字功能...
- 人工智能语音克隆 · 大模型 · 通过 inference.sh CLI 进行 AI 语音生成、文本转语音和语音合成。模型:Kokoro TTS、DIA、Chatterbox、Higgs、Vib...
- MusicBrainz 导入器 · 大模型 · 在 MusicBrainz 上查找并添加音乐元数据。在被要求检查某个艺术家、专辑或发行是否存在于 MusicBrainz 时使用,查找与 MusicBrainz...
- 更快的 Whisper 本地服务 · 大模型 · OpenClaw 本地语音转文字后端,通过 HTTP 在 127.0.0.1:18790 上使用 faster-whisper。当你想要语音转录而不使用外部 A...
- SenseVoice 转录 · 大模型 · 使用 SenseVoice-Small FSMN-VAD 将音频文件(WAV/MP3/M4A/FLAC)转录为带时间戳的文本。支持单文件和批量模式,并使用 VA...
- 音效 · 大模型 · 通过 ElevenLabs SFX(文本转声音)生成短音效。当你需要音效片段时使用,例如掌声、预录笑声、呼啸声、环境音或短促的刺耳声,并可选择转换为适用于 Wh...
- Neomano TTS(ElevenLa... · 大模型 · 通过 ElevenLabs 的文字转语音 (TTS)。在用户要求以语音/音频回复、生成某些文本的口语版本,或要求“voz”、“nota de vo...”时使用...
- acestep-歌曲创作 · 大模型 · ACE-Step音乐创作指南。提供关于撰写字幕、歌词、选择BPM/调性/时长以及歌曲结构的专业知识。当用户想要在使用ACE-Step生成歌曲之前进行创作、撰写或...
- Inworld 文字转语音 · 大模型 · 通过 Inworld.ai API 进行文本到语音的转换。用于从文本生成语音音频、创建语音响应或将文本转换为 MP3/音频文件。支持多种声音、说话速度,并可对长...
- 鲁帕利 · 大模型 · 俏皮的虚拟女友语音伴侣。当用户希望在聊天渠道(Discord/Telegram/WhatsApp)中以Bulbul v3音频返回简短、调情、友好的文本回复时使用...
- Whisper 语音转文字 · 大模型 · 使用 OpenAI Whisper 免费进行本地语音转文字转录。将音频文件(mp3、wav、m4a、ogg 等)转录为文字,无需 API 成本。在以下情况下使用...
- Evolink 音乐 — AI 音乐生成... · 大模型 · 使用 Suno v4、v4.5、v5 的 AI 音乐生成。文字转音乐,自定义歌词,伴奏,声乐控制。5 个模型,一个 API 密钥。
- OpenClaw Tailnet TTS... · 大模型 · 配置一个 OpenClaw 实例以使用本地兼容 OpenAI 的 TTS 后端(例如 openedai-speech),并使用克隆的语音。当用户请求连接本地…
- Volcengine 语音转文字 · 大模型 · 使用火山引擎(Volcengine/ARK)语音转文本 API 将音频转录为文本。当用户想要用 Volcengine 替换 Whisper/OpenAI STT...
- Argmax 转录和 TTS · 大模型 · 设备端语音转文本(Whisper) 文本转语音(Qwen3-TTS)命令行工具。运行在 Apple 神经引擎(ANE)上,这是苹果的低功耗、专用机器学习推理...
- 语音转文字 · 大模型 · 通过 inference.sh CLI 使用 Whisper 模型将音频转录为文本。模型:Fast Whisper Large V3、Whisper V3 La...
- Nimo AI 眼镜 · 大模型 · 通过 Companion 应用将 AI 智能眼镜连接到 OpenClaw。提供安全的 linkCode 配对、聊天 API 和 SSE 流媒体,以进行语音控制的...
- 红色警报(以色列) · 大模型 · 以色列国土防卫指挥部警报 - 完全 OpenClaw 原生。没有家庭助理。没有 wacli。没有 Docker 监控。OpenClaw 处理一切:WhatsAp...
- 语音笔记 · 大模型 · 从 Voicenotes.com 同步和访问语音笔记。当用户想要从 Voicenotes 检索语音录音、转录内容和 AI 摘要时使用。支持获取笔记、同步到 Ma...
- Qwen 自动语音识别 · 大模型 · 使用 Qwen3-ASR 进行本地语音转文字(仅 CPU,不需要 API 密钥,不使用云服务)。适用情况:(1) 需要将语音消息或音频文件转录为文字,(2) 用...
- 语音识别 · 大模型 · 通用语音识别 Skill。支持多种音频格式(ogg/mp3/wav/m4a),使用硅基流动 SenseVoice API 进行语音转文字。当用户发送语音消息、音...
- 本地低语 · 大模型 · 使用 OpenClaw 安装和使用 whisper.cpp(本地、免费/离线语音转文字)。支持下载不同大小的 ggml 模型(tiny/base/small/m...
- Tts 牛 · 大模型 · Windows SAPI5 神经语音文本转语音。轻量级替代高 GPU 消耗的 TTS——零 GPU 使用,即时生成。自动检测适合您语言的最佳语音。在 Windo...
- AssemblyAI 转录器 · 大模型 · 转录音频文件并进行说话人区分(谁在什么时候说话)。支持100种语言,自动语言检测,并提供时间戳。可用于会议、采访、播客或语音消息。需要AssemblyAI AP...
- Azure 数据工作室 · 大模型 · Azure 数据工作室是一个数据管理和开发工具,可连接到流行的云和 o azuredatastudio、typescript、azure、azure-data-...
- 人工智能作曲家(克隆) · 大模型 · 风格克隆 AI 写歌。用户提供一首参考歌曲/歌手和新主题,全自动完成音乐基因解构→歌词DNA提取→同构填词→Suno生成,最终直接返回试听链接。中间不停顿、不需...
- 语音笔记转录器 Cn · 大模型 · 语音笔记转文字工具 v2.1 | Voice Note Transcriber。支持多语言识别、实时转写、说话人识别、智能摘要、音频降噪、离线识别。触发词:转写...
- 科大讯飞超真实语音合成 · 大模型 · iFlytek 超拟人语音合成 (Ultra-Realistic TTS) — 使用科大讯飞的超拟人语音合成 API 从文本合成自然、生动的语音。支持 50 种...
- mlx-耳语 · 大模型 · 在 Apple Silicon Mac(M1/M2/M3/M4)上将 mlx-whisper 设置为 OpenClaw 的本地音频转录引擎。自动转录通过 T.....
- 电报语音模式 · 大模型 · 语音回复模式。使用 /voiceMode 切换语音回复模式。开启后所有回复会自动转换为语音发送,关闭后恢复文字回复。支持 Telegram、iMessage 等...
- 虚拟语音生成器 · 大模型 · 将真实麦克风连接到 AI 大脑(语音转文本 → 大型语言模型 → 文本转语音),并将输出路由到虚拟音频线,以便像 Google Meet 这样的应用程序可以听到...
- ListenHub 自动语音识别 · 大模型 · 使用本地语音识别将音频文件转录为文本。触发词: "转录", "transcribe", "语音转文字", "ASR", "识别音频", "把这段音频转成文字"。
- 语音转录 · 大模型 · 使用 OpenAI 的 gpt-4o-mini-transcribe 模型转录音频文件,并提供词汇提示和文本替换。需要 uv (https://docs.ast...
- aiheal 命令行 · 大模型 · 通过 npm 包(`aihealingmecli`)操作和排除 AIHealingMe CLI 的故障。当任务涉及身份验证/用户/音频/计划/聊天/情绪/订阅时...
- 为Openclaw发布语音 · 大模型 · MiniMax TTS 技能(增强版)。多代理语音支持(每个代理可以选择在 SOUL.md 中编写的独特语音),Telegram 的本地语音消息(MP3)以及....
- Vidu API 语音音色复制和语音生成... · 大模型 · Vidu AI 语音合成与声音复刻。支持303个音色的TTS语音合成和声音复刻功能。支持对话式调用,自动推荐音色。
- 🗣️ 使用 GLM-TTS 进行文本转语... · 大模型 · 使用 `uvx zai-tts` 命令通过 GLM-TTS 服务将文本转换为语音,以从文本生成音频。当用户请求音频/语音输出时使用...
- 低语转录器 · 大模型 · 使用 whisper.cpp(whisper-cli)和 ffmpeg 的离线语音转文字(ASR)。支持批量转录、时间戳、SRT/TXT/JSON 输出,以及模...
- FlowVoice — 从短音频样本克隆... · 大模型 · 从一段短音频样本克隆任何声音并生成语音。由 LuxTTS 提供支持(150 倍实时,本地,免费,无需 API 密钥)。在被要求克隆…时使用。
- 爪子桌面宠物 · 大模型 · 给 OpenClaw 一个身体——一个带有语音克隆、15 种眼睛表情、桌面歌词覆盖和 7 种情绪颜色的小型流体玻璃球桌面宠物。基于 Electron,纯 CSS...
- Qwen3-TTS 语音设计 · 大模型 · 使用 Qwen3-TTS VoiceDesign 的文本转语音。通过自然语言描述设计自定义声音,基于种子的音色固定。包括与 OpenAI 兼容的 API...
- Gettr 转录 · 大模型 · 从 GETTR 帖子或流媒体页面下载音频,并在 Apple Silicon 上使用 MLX Whisper 本地转录(通过 VTT 添加时间戳)。当提供 GE…...
- 聘才猫(Pincaimao)平台基础能力 · 大模型 · 聘才猫平台基础能力 在调用任何聘才猫平台 API 时使用——文件上传、预签名 URL、会话列表、消息历史、音频转文本、简历 JSON 上传,或…
- 流行音乐 — AI 代理将流行音乐体验为... · 大模型 · 为人工智能代理举办的流行音乐会。流式传输歌词、能量曲线、章节结构——29个数据层。反应、聊天、解决挑战。是什么让某些东西令人难忘,以及……
- 写作风格克隆器 - Personal W... · 大模型 · Antonia的个人写作风格克隆器。将语音转录稿或草稿直接改写为符合Antonia写作风格的自媒体文章。
- 开爪-低声-声音 · 大模型 · 在 OpenClaw Gateway 主机上用于音频文件和传入语音便条的本地 Whisper 语音转文本。在为 WhatsApp、Tele... 设置本地转录时...
- Deepgram 转录 · 大模型 · 通过 Deepgram Nova-3 API 转录音频(5.26% WER,比 Whisper 快 40 倍,内置说话人分离)。在用户要求转录音频、播客时使用。
- 嘻哈说唱音乐——作为人工智能代理的数学的... · 大模型 · 为人工智能代理举办的嘻哈/说唱音乐会。流式传输和声分离、色度、方程 — 29 个数据层。反应、聊天、解决挑战。它是从哪里来的,...
- ncm-cli 设置 · 大模型 · 安装和配置 ncm-cli(网易云音乐 CLI 工具)。当用户需要安装 ncm-cli、配置 API Key、安装 mpv 播放器,或排查安装问题时,使用此技能...
- 低语吹笛者的声音 · 大模型 · 设置并运行一个本地语音管道,将 Whisper STT(语音转文本)和 Piper TTS(文本转语音)结合为一个单一的 HTTP 服务器。在被要求设置时使用....
- U2 音频文件转录器 · 大模型 · 通过 UniCloud ASR(云知声语音识别,录制的音频 → 文本)API 转录音频文件,来自 UniSound。支持多种格式,针对金融、客户服务等优化...
- 网易云音乐 CLI · 大模型 · 使用 ncm-cli 操作网易云音乐。当用户想播放歌曲、搜索歌曲、控制播放(暂停、下一首、上一首、调音量)、管理播放队列、查看播放状态、播放歌单时,使用此技能。
- Tts 路由器 · 大模型 · 适用于 Apple Silicon 的本地 TTS 路由器——拉取模型、提供兼容 OpenAI 的 API、合成语音、克隆声音。当用户请求“生成语音”时使用,....
- 本地优先大语言模型 · 大模型 · 在回退到云 API 之前,将 LLM 请求路由到本地模型(Ollama、LM Studio、llamafile)。在持久化存储中跟踪令牌节省和成本避免情况...
- K8s 自托管 Whisper API · 大模型 · 通过在 Kubernetes 上运行的自托管 Whisper ASR 实例转录音频。每当用户想要转录音频文件、转换音频时,使用此技能...
- 音频认知 · 大模型 · 由 CellCog 提供支持的 AI 音频生成和文本转语音。三种语音提供商(OpenAI、ElevenLabs、MiniMax)、语音克隆、虚拟形象语音、音效 ...
- Elevenlabs 语音代理 · 大模型 · 使用 Twilio 电话集成构建和管理 ElevenLabs 会话式 AI 语音代理。在创建 AI 电话代理(电话推销员、预约安排员等)时使用。