So-VITS-SVC(原名)是托管于GitHub的开源项目,专注于歌声转换(SVC)而非文本转语音。它利用SoftVC内容编码器提取特征并保留原音频音高与语调,结合NSF HiFiGAN声码器优化音质。该项目为开发者提供框架,需用户自行训练模型,适用于学术研究与技术交流,不支持生产环境部署。
Notta.ai(原名Notta)是一款基于人工智能的语音转文本及会议笔记平台。它支持58种语言的实时转录,能自动将会议、访谈或录音转化为可搜索的文本,并生成摘要、行动项及可视化图表。适用于企业高管、销售团队、咨询师及教育工作者,帮助用户从对话中提取关键洞察,提升协作效率。
AI Vocal Remover & Instrumental Isolator(原名 LALAL)是一款基于人工智能的在线音频处理工具,旨在从音乐和视频中高精度提取独立音轨。它支持分离人声、伴奏及鼓、贝斯、吉他等多种乐器,并提供降噪、去混响及变声功能。用户只需上传文件即可快速获得专业级分轨结果,适用于音乐制作、内容创作及语音清理场景。
Audo Studio是一款功能全面的音频录音与制作站
十行笔记是一个免费的在线音视频转文章工具。
Your AI creative team, on demand(原名Designs.ai)是一款基于人工智能的在线创意创作平台。它通过专有AI技术,让用户无需设计经验即可快速生成Logo、视频及横幅等作品。平台引入AI Agent概念,用户只需输入简单需求,系统自动规划并调用合适模型,在保持品牌一致性的前提下,高效交付图像、视频、音频、幻灯片等多格式创意资产,适用于各类营销与设计场景。
Otter Meeting Agent(原名 Otter AI)是一款对话式知识引擎,能够自动录制会议、提供多语言实时转录,并生成包含决策和行动项的智能摘要。它支持通过桌面应用无机器人介入录音,或通过日历自动加入 Zoom、Teams 等会议。产品具备 AI 聊天搜索功能,可跨会议和应用回答问题,并能将洞察同步至 Salesforce、Slack 等工具,适用于销售、教育及企业团队协作场景。
Async是一款基于聊天的AI创意套件,专为视频内容生产设计。用户只需通过自然语言指令,即可在统一的工作流中完成从原始素材处理、AI场景生成到成品视频输出的全过程。核心功能涵盖智能剪辑、音频清理、配音生成、多语言翻译及社交媒体短片制作,适用于创作者、营销团队及企业用户,旨在降低专业视频制作门槛并提升生产效率。
Steve.AI是一款拥有多项专利的AI视频创作平台,支持将文本、博客、音频或提示词快速转化为专业视频。用户可生成生成式AI、真人实拍及动画等多种风格内容,无需剪辑技能或昂贵设备。该平台提供多语音叙事、动态视觉效果及移动端应用,适用于社交媒体营销、教育培训及广告制作,旨在帮助创作者高效产出高质量视频内容。
Audialab 是一套专为艺术家设计的人工智能音乐创作工具,原名 Emergent Drums。该套件包含 Emergent Drums、Humanize、Deep Sampler 和 Infinite Packs 等产品,旨在通过突破性技术生成独特的鼓采样并优化音频处理。用户可通过一次性购买获取全套产品访问权限,所有生成的采样均免版税,适用于需要高效创作独特声音素材的音乐制作人及音频工程师。
Beatoven AI Music Generator是一款基于人工智能的在线音乐创作平台,旨在为内容创作者提供原创且免版税的背景音乐。用户无需具备专业音乐知识,即可通过文本描述或参数调整生成个性化音轨。该工具支持视频、播客、游戏及社交媒体等多种场景,提供MP3和WAV格式下载,并附带明确的商业使用授权,帮助用户安全地将音乐融入创作中。
立即创作音乐并与世界分享。即使你以前从未制作过音乐,也可以在几秒钟内创建原创歌曲。在Spotify,TikTok,YouTube和全球其他40多个平台上每听一次都可以获得报酬。
MusicLM: Generating Music From Text 是由 Google Research 开发的人工智能模型,能够根据详细的文本描述生成高保真音乐。该模型将条件音乐生成视为分层序列到序列建模任务,可生成长达数分钟且保持一致性的 24 kHz 音频。它支持仅通过文本、或结合哼唱旋律进行创作,并在音频质量和对文本描述的遵循度上表现优异。此外,项目公开了包含丰富专家标注的 MusicCaps 数据集以支持后续研究。
Where Brands Become Music(原名Soundful)是一款专为品牌和企业打造的AI音乐生成平台。它结合专业制作人的创意直觉与伦理训练的AI技术,帮助用户快速创作原创、无版权风险的高质量音轨。用户可通过选择流派和模板,在几秒钟内生成独特的背景音乐或品牌声音标识,适用于广告、应用及各类商业场景,确保资产全球分发合规。
AIVA是一款人工智能音乐生成助手,能够在数秒内基于250多种风格创作原创歌曲。它支持从零开始生成或上传音频及MIDI文件作为影响源,并提供高度的自定义编辑功能。无论是初学者还是专业音乐人,均可通过AIVA简化创作流程。用户可根据需求选择不同订阅方案,以获取相应的版权所有权、商用许可及高品质音频下载权限,适用于视频配乐、游戏音效及个人创作等场景。
Create the music you imagine.(原名 Riffusion)是一款基于生成式人工智能的音乐创作平台。它允许用户通过文本提示或对话方式生成具备丰富音乐性和动态人声的完整歌曲。该平台集成了最新的 Lyria 3.5 音乐模型和 Veo 视频模型,支持从音频制作、AI 音乐视频生成到代码构建自定义乐器的一站式体验。用户无需信用卡即可免费开始使用,适合音乐爱好者、创作者及开发者探索个性化声音并分享作品。
Mubert: AI Music Streaming 是一款基于机器学习模型的人工智能音乐生成平台。它结合艺术家提供的样本库,根据用户输入的文本提示或参数即时生成独特的免版税音乐。该产品适用于视频创作者、播客主、开发者及品牌方,支持为YouTube、TikTok等内容提供合规的背景音轨,并提供API集成与听众流媒体服务。
Splash是一款互动式在线音乐创作平台,旨在让音乐制作更具社交性和协作性。用户可通过其应用程序访问丰富的声音库和节拍制作工具,或在Roblox虚拟世界中体验大型音乐舞台。平台支持即时创建独特曲目,并允许其他创作者基于原有混音进行二次创作,形成全球协作网络。Splash结合专有AI技术,提供文本生成音乐、人声转换等功能,适用于希望以趣味方式参与音乐创作、表演及互动的各类用户。
TTSLabs是一款专为Twitch主播设计的实时文本转语音(TTS)服务。它提供独立的桌面应用程序,支持自定义语音、添加独特声音片段及设置脏话过滤。该工具能与Streamlabs和StreamElements无缝同步,实现超快速音频生成,帮助主播高效管理观众打赏语音互动,提升直播间的娱乐性与互动体验。
The future of audio localization是RWS推出的企业级音频本地化解决方案,原名Papercup。该产品结合人工智能编排与人类专家审核,提供自然逼真的AI配音及专业语音服务。支持跨语言情感保留、多说话人检测及唇形同步调整,适用于影视、流媒体及大型企业的内容全球化分发,帮助客户在保持品牌安全与合规的前提下,加速内容上市并优化成本。
MetaVoice是一款专为营收通话设计的全双工语音模型。它能够在说话的同时持续监听,自然处理打断、重叠语音及背景噪音,显著降低用户挂断率并提升转化效果。该模型无需组装复杂的ASR或TTS组件,支持私有化部署于用户VPC,确保数据安全,并提供可调试、可观测的控制能力,适用于需要高自然度人机对话的商业场景。
Krisp是一款基于AI语音引擎的生产力平台,旨在提升会议清晰度与效率。其核心功能包括行业领先的背景噪音消除、实时口音转换、多语言会议转录及智能笔记生成。产品适用于个人、团队及呼叫中心,支持Zoom、Teams等主流会议软件,并提供移动端应用以覆盖线下及混合办公场景,帮助用户自动化处理会前准备、会中记录与会后总结。
Cleanvoice AI是一款基于人工智能的播客后期处理工具,旨在帮助用户快速去除录音中的背景噪音、填充词、长停顿及口腔杂音。用户无需掌握复杂剪辑技巧,只需上传音频或视频文件,即可自动获得演播室级别的音质。该平台支持多轨道编辑、自动转录及内容摘要生成,适用于播客创作者、媒体机构及需要高效处理音视频内容的专业人士,显著缩短后期制作时间。
Adobe Podcast是一款基于人工智能技术的在线音频处理平台,旨在帮助用户轻松实现专业级的音频录制、转录、编辑与分享。其核心能力包括利用AI消除背景噪音和回声以增强语音清晰度,以及通过麦克风检测优化录音质量。该产品完全基于Web端运行,无需安装复杂软件,适用于播客创作者、内容制作人及需要高质量语音内容的各类用户,致力于让每一次录音都清晰 crisp and clear。
AssemblyAI,提供语音识别、说话人检测、语音摘要等多种人工智能模型。
免费享受近乎完美的乐器和歌声隔离!
Altered是一款专业的AI语音转换软件,提供独特的语音到语音(Speech-To-Speech)变形技术。它允许用户将声音转换为精心策划的AI人声或自定义声音,支持实时低延迟变声及后期制作编辑。适用于游戏玩家、呼叫中心、媒体创作者及有语音障碍的人群,旨在创造引人入胜的专业语音表演,同时保留原始表达的节奏与语调。
The #1 AI Assistant For Your Meetings(原名 Fireflies.ai)是一款专注于会议场景的 AI 助手,能够自动录音、转录并生成详细摘要。它支持多语言识别、说话人区分及实时辅助,帮助用户搜索历史对话、提取待办事项并整合至 CRM 等工作流中。适用于需要高效记录会议内容、沉淀团队知识库的企业与个人用户,提供符合 GDPR 和 SOC2 标准的企业级数据安全保护。
Supernormal是一个AI会议记录工具,能够自动把Google Meet会议的内容转换成文字并记录下来。使用它每次会议能省下五到十分钟,而且记录可以马上分享到Google Drive, Notion, Quip,...
Speechify是一款全能的语音AI生产力助手,支持在iOS、Android、Mac、Windows及浏览器端使用。其核心功能包括将PDF、文档和网页转化为逼真的人声朗读,提供高速语音输入(Voice Typing)以替代打字,并能通过语音交互进行内容总结、问答及播客生成。适用于学生、专业人士及有阅读障碍的用户,旨在提升信息获取效率与无障碍体验。