一款智能语音助手,集语音速记、音视频转文字、AI智能总结、文字生成配音等多种功能于一体,可实现毫秒级的实时录音转写,支持多语种识别转写和精准翻译
一款功能强大的AI视频转图文助手,可生成原汁原味且可读性强的原文讲稿,支持视频/音频图文转录、翻译、总结,思维导图大纲,讲座、播客、访谈、会议转录和总结。
大饼 AI 变声:专业的实时AI变声器是一款基于深度学习技术的实时语音处理软件。它提供低于100ms的超低延迟和超过500种预设音色,无需高端显卡即可在Windows和Mac上流畅运行。产品适用于游戏开黑、直播互动及社交语聊等场景,支持全平台接入,帮助用户轻松实现自然、高质量的变声体验。
万兴天幕AI(原名万兴天幕)是一款基于多模态大模型的AIGC创作工具,具备文生视频、图生视频、视频续写、文生图片及音频生成等核心能力。用户可通过文字指令或参考图精准控制画面与声音细节,实现从灵感到成品的快速转化。该产品适用于内容创作者、设计团队、品牌营销人员及摄影后期工作者,旨在通过全链路AI赋能,提升数字创意内容的生产效率与质量。
悟声 AI(原名 Reecho睿声)是一款提供超拟真语音合成与瞬时声音克隆技术的平台。用户可通过上传音频样本快速克隆声音,或利用文字描述从零设计全新声音角色,亦能基于现有角色进行微调。平台支持多语言配音生成,内置声音角色市场供用户发现与分享优质AI声音,适用于内容创作、配音制作等场景,并配备合规审查机制以保障使用安全。
www.minimaxi.com/audio是MiniMax旗下基于人工智能技术的音乐创作平台(原名海螺音乐)。该产品依托MiniMax Music 2.0模型,能够将用户的灵感转化为高质量的音乐作品。用户可通过先进的AI算法轻松生成原创音乐,并与社区分享创作成果或发现其他创作者的作品,适用于需要高效音乐内容生成的各类场景。
由脍炙人口的国内长视频社交平台B站(哔哩哔哩)推出的一款视频剪辑工具,它集成了数字分身、音色合成、智能抠图等多种AI功能。
天工SkyMusic”的推出,不仅展示了昆仑万维在AI音乐生成领域的技术实力,也为音乐创作者和爱好者提供了广阔的创作空间。随着AI技术的不断发展,“天工SkyMusic”将继续创新和完善,推..
短剧集CPS推广分享平台,提供AI解说大师一键成片,全民可用的免费影视创作智能工具
hailuoai.video(原名海螺AI)是一款创新的AI视频生成平台,致力于将文本想法转化为精美的视觉作品。用户只需输入文字提示,即可借助先进的多模态人工智能技术,在短时间内创作出引人入胜的视频内容。该平台支持多种风格转绘、广告电商素材生成及趣味特效制作,适用于内容创作者、营销人员及视频爱好者,旨在通过智能化手段降低视频制作门槛,释放用户的创造力。
一款面向音乐人及音乐爱好者的音乐创作辅助工具,它提供多种人工智能歌手的声音选择,快速生成高质量的音乐作品。
Seamless Communication 是 Meta 开源的先进人工智能模型家族,旨在实现跨语言的自然交流。原名 SeamlessM4T v2 的核心模型支持近 100 种语言的语音和文本高质量互译。该套件包含专注于保留语调和声音风格的 SeamlessExpressive,以及支持实时流式翻译的 SeamlessStreaming。开发者可通过 GitHub 获取代码、预训练模型及详细教程,适用于构建多语言翻译应用及学术研究。
Musicfy AI(原名Musicfy)是一款人工智能音乐制作平台,核心功能包括AI语音歌曲生成、人声克隆及文本转音乐。用户可从超过10万种声音库中选择,或创建个人专属声音模型,制作AI翻唱作品。平台提供版权免费的声音和伴奏资源,支持商业安全使用,适用于音乐创作者、内容制作人及希望探索AI音频技术的用户。
GitHub上的RVC-Project项目(原名RVC变声器)是一个开源的语音音色转换框架。它支持通过少量数据快速训练高质量模型,并提供实时变声功能。该工具采用先进的RMVPE算法提取音高,有效解决哑音问题,并具备低延迟特性。用户可通过WebUI界面进行模型训练、推理及人声伴奏分离,适用于开发者及音频爱好者进行声音转换实验。
Kits AI是一个专为音乐制作人设计的AI音频工具平台,提供录音室级别的语音克隆、人声分离、AI母带处理及乐器演奏生成等功能。用户可通过其丰富的免版税声音库或自定义训练模型,实现多风格演唱与配音,所有生成内容均支持商业使用且无版权纠纷,旨在简化音乐制作流程并提升创作效率。
SongTell是一个AI歌曲鉴赏平台。SongTell结合了人工智能技术和歌曲鉴赏,为用户提供了一个全新的方式来感受和理解歌曲。通过SongTell,用户能够深入探索歌曲的歌词,理解其中的故事和情感,获得更加丰富的音乐体验。
Make Audio(原名AudioShake)是一款基于人工智能的音频处理平台,能够将任意录音分解为独立的音轨,包括人声、乐器、对话及音效。该平台提供高精度的多说话人分离、音乐分轨提取以及自动歌词转录与对齐功能。用户可通过上传音频文件选择相应模型,快速生成可用于混音、本地化配音、互动媒体及版权合规的高质量分轨素材,适用于音乐制作、影视后期及内容分析等专业场景。
Stable Audio是一款基于人工智能的生成式音频工具,旨在帮助用户创作原创音乐和音效。无论用户是初学者还是专业人士,均可通过输入文本提示词,自动生成符合特定风格和描述的音频文件。该工具降低了音频创作的门槛,适用于需要快速制作背景音乐、环境音效或创意声音素材的场景,支持从简单概念到完整音频片段的转化。
悦音配音是制片帮旗下推出的AI智能在线配音工具,提供文字转语音及真人配音服务。产品拥有海量音色库,支持情绪主播、多人角色配音及声音克隆,具备WAV无损音质和商用授权能力。适用于短视频制作、影视解说、政企宣传、教育培训及有声读物等多种场景,帮助用户高效生成媲美真人的高质量音频内容。
面向音乐人的一站式创作平台(原名Moises)是一款基于人工智能的音乐辅助应用,核心能力包括高精度音轨分离、和弦检测、速度控制及歌词转录。用户可通过网页端或移动端上传音频,快速提取人声、鼓点等独立音轨,或利用AI生成Stem与人声轨道进行二次创作。该平台适用于练习演奏、混音制作及团队协作,旨在帮助音乐人将灵感转化为现实作品。
Rask AI是一款面向全球企业的AI音视频本地化平台,支持将视频和音频翻译并配音为130多种语言。其核心功能包括32种语言的语音克隆、唇形同步、多说话人检测及自动生成字幕。通过Web界面或API,创作者和企业可高效打破语言障碍,实现内容规模化出海,同时具备SOC 2 Type II安全认证,保障数据安全。
商汤如影是商汤科技推出的AI数字人视频生成平台,基于“日日新SenseNova”大模型体系。它支持通过文字、录音或PPT快速合成高清数字人短视频,并提供复刻直播间功能,实现7x24小时智能互动直播。产品无需专业拍摄设备,适用于电商带货、教育培训及企业营销等场景,帮助用户低成本高效创作内容。
字节跳动旗下飞书出品基于AI人工智能的在线音视频转文字工具
字节跳动商业化官方营销创意交流服务平台,内容创作AI辅助工具
火山引擎TTS(Text-to-Speech)是一种基于云计算的语音合成服务,可以将文本转化为自然、流畅的语音。
语音合成(原名阿里云TTS)是一种基于深度学习技术的智能语音服务,能够将文本高效转换为自然、流畅且高拟真度的语音。该产品提供约110种音色选择,支持调节语速、语调及音量,并兼容SSML标记语言。适用于智能客服、有声阅读、导航播报及虚拟形象交互等场景,帮助企业打通人机交互闭环,提升用户体验并降低运营成本。
Voicemaker是一款基于人工智能的文字转语音(TTS)在线工具,能够将文本转化为逼真的真人语音。平台提供超过2000种AI声音,支持130多种语言和口音,涵盖叙事、对话、动画等多种风格。用户可调整语速、音调和停顿,生成MP3或WAV格式音频,适用于视频配音、演示文稿及多媒体内容创作。
Uberduck是一个运用人工智能技术的AI文本转语音配音平台
一站式 AI 平台(原名 Easy-Peasy.AI)是一款综合型人工智能创作工具,整合了文本写作、图像设计、音频处理、视频生成及语音转录等核心能力。该平台支持接入多种主流大语言模型,提供可视化工作流和智能体功能,帮助用户自动化完成内容创建、代码运行及数据分析等任务。适用于创作者、营销团队及企业用户,旨在通过统一的界面简化多模态内容生产流程,提升工作效率。
Synthesys AI Video Agent是一款基于人工智能的视频生成平台,原名Synthesys。它通过协调Sora 2、Google VEO等前沿AI模型,帮助用户从单一提示词快速制作广告、UGC内容、培训视频及商业宣传片。平台提供1000多个AI数字人、400多种配音及140多种语言支持,无需拍摄或剪辑技能,显著降低视频制作成本与时间,适用于市场营销团队、电商品牌及内容创作者。