一款智能语音助手,集语音速记、音视频转文字、AI智能总结、文字生成配音等多种功能于一体,可实现毫秒级的实时录音转写,支持多语种识别转写和精准翻译
一款功能强大的AI视频转图文助手,可生成原汁原味且可读性强的原文讲稿,支持视频/音频图文转录、翻译、总结,思维导图大纲,讲座、播客、访谈、会议转录和总结。
大饼 AI 变声:专业的实时AI变声器是一款基于深度学习技术的实时语音处理软件。它提供低于100ms的超低延迟和超过500种预设音色,无需高端显卡即可在Windows和Mac上流畅运行。产品适用于游戏开黑、直播互动及社交语聊等场景,支持全平台接入,帮助用户轻松实现自然、高质量的变声体验。
悟声 AI(原名 Reecho睿声)是一款提供超拟真语音合成与瞬时声音克隆技术的平台。用户可通过上传音频样本快速克隆声音,或利用文字描述从零设计全新声音角色,亦能基于现有角色进行微调。平台支持多语言配音生成,内置声音角色市场供用户发现与分享优质AI声音,适用于内容创作、配音制作等场景,并配备合规审查机制以保障使用安全。
由脍炙人口的国内长视频社交平台B站(哔哩哔哩)推出的一款视频剪辑工具,它集成了数字分身、音色合成、智能抠图等多种AI功能。
Lingo语音大模型是由西湖心辰开发的端到端语音人工智能产品。该模型集成实时打断与实时控制能力,通过超拟人化的互动方式提升对话生动性。它具备快速响应复杂指令及深度理解用户情感的能力,旨在重塑沟通体验,适用于需要自然、直观人机语音交互的场景。
短剧集CPS推广分享平台,提供AI解说大师一键成片,全民可用的免费影视创作智能工具
Seamless Communication 是 Meta 开源的先进人工智能模型家族,旨在实现跨语言的自然交流。原名 SeamlessM4T v2 的核心模型支持近 100 种语言的语音和文本高质量互译。该套件包含专注于保留语调和声音风格的 SeamlessExpressive,以及支持实时流式翻译的 SeamlessStreaming。开发者可通过 GitHub 获取代码、预训练模型及详细教程,适用于构建多语言翻译应用及学术研究。
Seamless M4T是由Meta AI开发的一体化多语言多模态翻译大模型。该模型旨在打破语言障碍,支持文本与语音之间的双向转换。作为开源项目,它通过Hugging Face Spaces提供在线演示空间,允许用户探索其在多种语言间的翻译能力。适用于需要跨语言沟通的研究人员、开发者及对AI翻译技术感兴趣的用户,帮助理解前沿语音与文本处理技术的实际应用。
秒创是基于秒创AIGC引擎的智能AI内容生成平台,为创作者和机构提供AI生成服务。
商汤如影是商汤科技推出的AI数字人视频生成平台,基于“日日新SenseNova”大模型体系。它支持通过文字、录音或PPT快速合成高清数字人短视频,并提供复刻直播间功能,实现7x24小时智能互动直播。产品无需专业拍摄设备,适用于电商带货、教育培训及企业营销等场景,帮助用户低成本高效创作内容。
火山引擎TTS(Text-to-Speech)是一种基于云计算的语音合成服务,可以将文本转化为自然、流畅的语音。
语音合成(原名阿里云TTS)是一种基于深度学习技术的智能语音服务,能够将文本高效转换为自然、流畅且高拟真度的语音。该产品提供约110种音色选择,支持调节语速、语调及音量,并兼容SSML标记语言。适用于智能客服、有声阅读、导航播报及虚拟形象交互等场景,帮助企业打通人机交互闭环,提升用户体验并降低运营成本。
Voicemaker是一款基于人工智能的文字转语音(TTS)在线工具,能够将文本转化为逼真的真人语音。平台提供超过2000种AI声音,支持130多种语言和口音,涵盖叙事、对话、动画等多种风格。用户可调整语速、音调和停顿,生成MP3或WAV格式音频,适用于视频配音、演示文稿及多媒体内容创作。
Uberduck是一个运用人工智能技术的AI文本转语音配音平台
一站式 AI 平台(原名 Easy-Peasy.AI)是一款综合型人工智能创作工具,整合了文本写作、图像设计、音频处理、视频生成及语音转录等核心能力。该平台支持接入多种主流大语言模型,提供可视化工作流和智能体功能,帮助用户自动化完成内容创建、代码运行及数据分析等任务。适用于创作者、营销团队及企业用户,旨在通过统一的界面简化多模态内容生产流程,提升工作效率。
NaturalReader AI Text to Speech是一款基于先进人工智能技术的多功能语音合成平台,原名NaturalReader。它能够将PDF、Word、网页及实体书等多种格式的文本转化为自然流畅的音频,支持跨设备同步与离线收听。产品提供个人阅读、商业配音及教育辅助等多种解决方案,具备AI摘要、截图分析、语音克隆及沉浸式阅读功能,旨在提升阅读效率、辅助学习并满足专业配音需求。
MotionSound_在线AI文本转语音工具是一款基于深度神经网络技术的智能语音合成平台。它能够将文本高效转换为流畅、自然的音频,支持多场景主播选择与个性化编辑。该工具适用于课件制作、广告宣传及语音导航等需求,帮助用户快速生成高保真语音并下载音频文件,提升内容创作效率。
Lovo.ai是一个基于人工智能的语音合成平台,提供了多种语音风格选择、语速调整、情感表达、语音转换为文字等功能
Listnr AI是一款专业的在线人工智能语音生成工具,支持142种语言和1000多种逼真音色。用户可通过文本转语音技术快速创建画外音,支持声音克隆、情感微调及多说话人对话生成。该工具适用于视频配音、有声书制作、播客创作及无障碍辅助场景,并提供商业使用授权,帮助用户高效产出高质量音频内容。
IBM Text to Speech(原名 IBM Watson Text to Speech)是一项基于云的API服务,能够将书面文本转换为多种语言和声音的自然语音。它支持深度神经网络生成的逼真音色,并提供品牌定制语音功能。该服务适用于提升客户体验、增强无障碍访问及自动化客户服务场景,可灵活部署于公有云、私有云或本地环境。
ElevenLabs Homepage是基于人工智能技术的语音与音频创作平台,原名Elevenlabs.io。它提供超逼真文本转语音、语音克隆、多语言配音及AI音乐生成功能,支持70多种语言。平台还包含ElevenAgents智能客服系统和ElevenAPI开发者接口,适用于企业、创作者及开发人员,旨在通过先进的音频AI技术提升内容创作效率与客户体验。
AI 语音生成器是 Clipchamp(原名)提供的免费在线文本转语音工具,支持将文字快速转换为逼真的视频画外音。用户无需下载软件,即可在浏览器中选择 400 多种声音、80 种语言及调整语速情感。该工具适用于社交媒体短视频、企业演示及教育内容制作,并支持导出 MP3 音频或结合 AI 字幕提升视频无障碍体验。
Foundry Tools 中的 Azure 语音(原名 Azure AI 语音)是微软提供的云端语音服务,支持语音转文本、文本转语音及实时翻译。开发者可通过 SDK 和 API 将自然语音能力集成至应用中,利用定制声音模型和多语言支持构建生成式 AI 智能体,适用于呼叫中心转录、虚拟形象交互及多模态应用场景。
语音合成(TTS)是一项将文本转化为超拟人化语音的技术服务,旨在打通人机交互闭环。该产品提供丰富的平台音色及自定义音色选项,支持模拟多种情感与语气,具备高自然度与强情绪表现力。用户可通过调整音量、语速等参数,选择离线文件或实时音频流格式,满足智能客服、新闻播报、有声阅读及虚拟人等多样化场景需求,为应用带来更具沉浸感的交互体验。
出门问问推出的一款 AI 配音工具和高效多人音频协同创作工具,可以智能将文字转换成语音,支持多种语言和语音风格,包括中文、英文、日语、韩语等。
百度智能云语音合成(TTS)是一项基于人工智能的文本转语音服务,利用深度神经网络与大模型技术,将文字转换为自然流畅的语音。支持在线、离线及流式合成,提供情感控制、声音复刻及多语言支持,适用于阅读听书、智能硬件、资讯播报等场景,助力应用实现拟人化交互。
So-VITS-SVC(原名)是托管于GitHub的开源项目,专注于歌声转换(SVC)而非文本转语音。它利用SoftVC内容编码器提取特征并保留原音频音高与语调,结合NSF HiFiGAN声码器优化音质。该项目为开发者提供框架,需用户自行训练模型,适用于学术研究与技术交流,不支持生产环境部署。
Your AI creative team, on demand(原名Designs.ai)是一款基于人工智能的在线创意创作平台。它通过专有AI技术,让用户无需设计经验即可快速生成Logo、视频及横幅等作品。平台引入AI Agent概念,用户只需输入简单需求,系统自动规划并调用合适模型,在保持品牌一致性的前提下,高效交付图像、视频、音频、幻灯片等多格式创意资产,适用于各类营销与设计场景。
Speechify是一款全能的语音AI生产力助手,支持在iOS、Android、Mac、Windows及浏览器端使用。其核心功能包括将PDF、文档和网页转化为逼真的人声朗读,提供高速语音输入(Voice Typing)以替代打字,并能通过语音交互进行内容总结、问答及播客生成。适用于学生、专业人士及有阅读障碍的用户,旨在提升信息获取效率与无障碍体验。