Step Audio 3

Step Audio 3 是阶跃星辰推出的语音大模型系列,涵盖 Realtime 实时对话、ASR 语音识别、TTS 语音合成、Gen 音频生成与 Music 音乐创作,Realtime 语音推理准...
阅读原文

YuE2

YuE2 是香港科技大学与 M-A-P 团队开源的音乐生成模型,YuE 的升级版本。它采用白盒乐谱规划机制,根据歌词与风格先生成可编辑 ABC 乐谱再渲染 48kHz 完整歌...
阅读原文

法界通

法界通是面向中国用户的一站式 AI 法律服务平台,整合法律内容社区、公开咨询、AI 法律助手与零中介费的律师认证撮合,支持 Web 与 iOS 多端互通。本站详解其...
阅读原文

HiDream-O1-Video-1.0

HiDream-O1-Video-1.0(简称HD-V1)是智象未来(HiDream.ai)推出的原生全模态视频生成模型,支持文本、图片、视频输入,一键直出5–20秒1080p视频,音画原生...
阅读原文

UnifoLM-WLA-1.0

UnifoLM-WLA-1.0是宇树科技推出的6B具身多模态大模型,基于约2500小时真机数据训练,视觉、语言与动作统一建模,单模型统筹54项桌面操作与10项全身移动任务,...
阅读原文

书生-S2

书生-S2(Intern-S2)是上海人工智能实验室开源的397B多模态基础大模型,主打AI for Science,Memory Decoder架构支持可插拔专业记忆,无需重训主模型即可扩...
阅读原文

豆包工作电脑端实测

我们实测了豆包工作电脑端:飞书日报周报自动提交、53分钟访谈音频转写与可视化信息图、报销流程封装成Skill、PPT一键生成与在线修改四个真实场景,验证其云...
阅读原文

WooMoo

WooMoo是Romangic团队推出的AI塔罗应用,主打以心理学为底、用塔罗语言表达的情绪陪伴。支持文字与语音提问,摇手机洗牌、滑动选牌后由AI生成个性化解读,内...
阅读原文

Xiaomi-CocktailASR-1

Xiaomi-CocktailASR-1 是小米开源的目标说话人语音识别大模型,以参考语音为声纹提示,无需语音分离即可从多人混合语音中转录指定说话人,支持空文本拒识与 C...
阅读原文

LingBot-World 2.0

LingBot-World 2.0 是蚂蚁灵波科技开源的实时交互世界模型,可像游戏一样实时操控,支持攻击施法跳跃与雨雪事件,小时级生成不漂移,高配达 720P/60FPS,1.3B...
阅读原文

Kimi K2.8 Preview

Kimi K2.8 Preview 是月之暗面推出的新一代主力编程模型,已在 Kimi Code 与 Kimi Work 全量上线,编码与 Agent 能力较 K2.7 提升,支持 low/high/max 三档思...
阅读原文

GPT-6 Astra vs Claude Fable 5.1 vs Gemini 3.8 Flash

我用 GPT-6 Astra、Claude Fable 5.1 与 Gemini 3.8 Flash 跑了 Blender 微缩书店、雨滴小游戏、书店改造 SVG、咖啡店客流图解、旧书夜市海报、月相科普图、...
阅读原文

Town

Town 是主动型 AI 个人助理,不止于在聊天框等待提问。连接用户邮箱和日历后,Town 会持续学习其联系人、日程与习惯,主动承担事务:Routines 引擎可预设清晨...
阅读原文

AI 种草带货视频制作教程

AI 种草带货视频制作教程:第一人称实测电商 AI Agent WaClaw,覆盖专属模特形象定制、高质感买家秀种草图、爆款风格换装视频复刻、店铺风格 Skill 沉淀与商...
阅读原文

ABot-Earth 0.7

ABot-Earth 0.7 是高德推出的全球首个 3D 原生城市世界模型:输入卫星图或文字,10 分钟在消费级 GPU 生成公里级 3D 城市,端到端输出 3DGS,覆盖 196+ 国家...
阅读原文
1231,676