标签:语音识别

WPS接入DeepSeek,秒变办公神器!

WPS 大家经常用来日常写作,虽然本身提供了AI功能,但可惜需要会员,本文教你三分钟接入最火的DeepSeek,让WPS秒变办公神器。 DeepSeek API申请地址:http:/...
阅读原文

AI赚钱副业~AI生成影视解说,半个月涨粉变现3.5W+!

这两年大家都在感叹生活不易,然而我想说的是,机会还是有的,但问题不在于有没有,而在于你是否能够认准机会,然后抓住它。 接触过很多咨询项目的人,发现...

R2T2

R2T2 是网易有道开源的低延迟真流式语音识别模型,基于 Qwen3-ASR,通过稳定前缀与 Commit/Wait 解码实现已提交文字不回改,平均延迟约 200 至 600 毫秒,支...
阅读原文

Spark-Audio-1.0-Preview

Spark-Audio-1.0-Preview 是科大讯飞发布的语音基座大模型,采用 0.65B 音频编码器与 30B-A3B MoE 语言模型,基于 1300 万小时音频在国产算力上训练,支持 99...
阅读原文

Step Audio 3

Step Audio 3 是阶跃星辰推出的语音大模型系列,涵盖 Realtime 实时对话、ASR 语音识别、TTS 语音合成、Gen 音频生成与 Music 音乐创作,Realtime 语音推理准...
阅读原文

Xiaomi-CocktailASR-1

Xiaomi-CocktailASR-1 是小米开源的目标说话人语音识别大模型,以参考语音为声纹提示,无需语音分离即可从多人混合语音中转录指定说话人,支持空文本拒识与 C...
阅读原文

FireRedAudio

FireRedAudio是小红书FireRed团队开源的通用音频语言模型,基于9B参数Qwen3.5自回归LLM,双通道解耦架构统一支持102语种语音识别、音频问答、Zero-shot TTS、...
阅读原文

Gemini 3.5 Transcribe

Gemini 3.5 Transcribe 是 Google 最新语音转文本模型,支持 Live API 亚秒级实时流式与离线高精度转录,词错误率流式 4.0%、非流式 2.6%,覆盖 85+ 语言与最...
阅读原文

StepAudio 2.5 ASR

StepAudio 2.5 ASR 是阶跃星辰推出的新一代自动语音识别模型,专为语音转写、会议纪要与长音频处理设计。模型采用 Audio Encoder + Linear Adapter + 4B LLM ...
阅读原文

Fun-ASR1.5

Fun-ASR1.5是阿里通义团队推出的端到端语音识别大模型的新一代版本,单模型支持30种语言高精度识别,覆盖中文七大方言体系及二十余种地方口音,专项优化古诗...
阅读原文

Mobvoi MCP Server

Mobvoi MCP Server 是出门问问推出的一站式集成各项 AI 能力的工具,Mobvoi MCP Server集成语音生成、声音克隆、图片驱动数字人、视频配音等多项多模态 AI 能...
阅读原文

Largo

Largo是基于AI技术加速影视内容开发的创新平台。平台分析海量影视数据(包括超过40万部电影和电视剧、95万名演员、5.9万个剧本等),为影视制作提供数据驱动...
阅读原文

CoGenAV

CoGenAV - 通义联合深圳技术大学推出的多模态语音表征模型
阅读原文

幻舟AI

幻舟AI是一站式AI短片创作平台,支持批量生成广告片、宣传片、动画片等。基于Midjourney、Runway等全球领先的AI模型,实现剧本创作、角色设计、分镜生成及视...
阅读原文

SOM AI

SOM AI 是 AI 辅助学术写作工具,帮助学生轻松完成毕业论文(Skripsi)和学术研究。工具基于自然语言交互,提供研究主题头脑风暴、段落释义、简化复杂内容等...
阅读原文

Unmute

Unmute 是 Kyutai 推出的低延迟语音交互系统,专注于低延迟语音转文字(Speech-to-Text)和文字转语音(Text-to-Speech)。Unmute 基于先进的 AI 模型,为用...
阅读原文

LLaDA-V

LLaDA-V是中国人民大学高瓴人工智能学院、蚂蚁集团推出的多模态大语言模型(MLLM),基于纯扩散模型架构,专注于视觉指令微调。模型在LLaDA的基础上,引入视...
阅读原文
123…16