标签:语音识别
WPS接入DeepSeek,秒变办公神器!
WPS 大家经常用来日常写作,虽然本身提供了AI功能,但可惜需要会员,本文教你三分钟接入最火的DeepSeek,让WPS秒变办公神器。 DeepSeek API申请地址:http:/...
AI赚钱副业~AI生成影视解说,半个月涨粉变现3.5W+!
这两年大家都在感叹生活不易,然而我想说的是,机会还是有的,但问题不在于有没有,而在于你是否能够认准机会,然后抓住它。 接触过很多咨询项目的人,发现...
Spark-Audio-1.0-Preview
Spark-Audio-1.0-Preview 是科大讯飞发布的语音基座大模型,采用 0.65B 音频编码器与 30B-A3B MoE 语言模型,基于 1300 万小时音频在国产算力上训练,支持 99...
Step Audio 3
Step Audio 3 是阶跃星辰推出的语音大模型系列,涵盖 Realtime 实时对话、ASR 语音识别、TTS 语音合成、Gen 音频生成与 Music 音乐创作,Realtime 语音推理准...
Xiaomi-CocktailASR-1
Xiaomi-CocktailASR-1 是小米开源的目标说话人语音识别大模型,以参考语音为声纹提示,无需语音分离即可从多人混合语音中转录指定说话人,支持空文本拒识与 C...
FireRedAudio
FireRedAudio是小红书FireRed团队开源的通用音频语言模型,基于9B参数Qwen3.5自回归LLM,双通道解耦架构统一支持102语种语音识别、音频问答、Zero-shot TTS、...
Gemini 3.5 Transcribe
Gemini 3.5 Transcribe 是 Google 最新语音转文本模型,支持 Live API 亚秒级实时流式与离线高精度转录,词错误率流式 4.0%、非流式 2.6%,覆盖 85+ 语言与最...
StepAudio 2.5 ASR
StepAudio 2.5 ASR 是阶跃星辰推出的新一代自动语音识别模型,专为语音转写、会议纪要与长音频处理设计。模型采用 Audio Encoder + Linear Adapter + 4B LLM ...
Mobvoi MCP Server
Mobvoi MCP Server 是出门问问推出的一站式集成各项 AI 能力的工具,Mobvoi MCP Server集成语音生成、声音克隆、图片驱动数字人、视频配音等多项多模态 AI 能...