英伟达开源的自动驾驶 AI 推理模型,基于 Cosmos 3 Super Reasoner,LingoQA 基准第一,OpenMDW-1.1 许可开源
商汤开源的轻量级原生统一多模态模型预览版,8B-MoT 参数原生支持 4K 图像生成、中英文文字渲染与图像编辑。
智源与北大联合开源的音视频联合编辑模型,一句指令同时修改画面与声音
Qwen团队推出的原生Computer Use Agent,纯视觉感知界面并用键鼠事件操控软件
京东开源自研的实时流式视频编辑模型,16B参数自回归扩散架构支持任意时长边播边改
Sand.ai开源的千亿参数MoE多模态视频生成模型,114B总参数仅激活6B
Mistral AI开源的3B多模态内容安全分类模型,审核策略可用自然语言实时定义
Mistral 官方大模型 API 平台
低价开源大模型推理 API
VORAvideo连接多AI模型,支持文生视频、图生视频,享Sora 2特惠
DreamOmni2 是统一的多模态 AI 模型,支持基于指令的图像编辑与生成,精度超越商业模型。
用于理解任意视频中的相机运动的工具。
一款具有 17 亿参数的开源图像生成基础模型。
提供高级 AI 聊天体验,完全私密。
Wan AI 是阿里巴巴开源 Wan 2.1 驱动的免费在线AI视频生成工具,支持文本与图片快速生成高质量短视频。
SkyReels V1 是一个开源的人类中心视频基础模型,专注于高质量影视级视频生成。
HunyuanVideo-I2V 是腾讯推出的基于 HunyuanVideo 的图像到视频生成框架。
Llasa-3B 是一个基于 LLaMA 的文本到语音合成模型,支持中英文语音生成。
Llasa-1B 是一个基于 LLaMA 的文本转语音 (TTS) 模型,支持中英文语音合成。
一个基于强化学习优化的大型语言模型,专注于数学问题解决能力的提升。
Wan2.1-T2V-14B 是一款高性能的文本到视频生成模型,支持多种视频生成任务。
CSM 1B 是一个由 Sesame 开发的文本到语音生成模型,可生成高质量的音频。
提供深度思考推理能力的开源人工智能大模型DeepSeek AI深度推理官网入口网址
将静态图像一键转换为高质量、语义准确、时空连续的动态视频。
一个开源的视频生成模型,用于创造生动的视频内容。
ComfyUI中集成的最新视频生成模型
一个拥有8200万参数的前沿文本到语音(TTS)模型。
Qwen2.5-Coder系列的3B参数指令调优模型
Qwen2.5-Coder系列中的1.5B参数代码生成模型
Qwen2.5-Coder系列中的3B参数指令调优模型
Qwen2.5-Coder系列中的3B参数量指令调优模型