AI项目和框架

Kling 4.0

Kling 4.0 由快手可灵打造,轻量级 Flash 版本已抢先开放体验。单次可原生生成最长 30 秒视频,支持最多 10 张关键帧与 15 项多模态参考输入,具备 4K 10-bit...
阅读原文

Claude Sonnet 5.5

Claude Sonnet 5.5 由 Anthropic 推出,Terminal-Bench 4.0 得分 70.6%,高于 Opus 5.5 的 66.4%。API 输入 $2/M、输出 $10/M,单价仅为 Opus 5.5 一半,支持...
阅读原文

M3.1-Flash-Preview

M3.1-Flash-Preview 是 MiniMax 面向日常研发场景的文本编程模型,原生多模态输入、100 万 token 超长上下文、low 到 max 五档推理强度可调,首字延迟约 280m...
阅读原文

Space Bunny

Space Bunny(太空兔)是以匿名形式登陆 OpenRouter 与 OpenCode 的高速多模态 AI 大模型,100 万 Token 上下文、524K 输出上限,支持 low/high/max 三档推理...
阅读原文

Kev

Kev 是开源的 Jev 风格决策模型家族,提供 0.8B 到 27B 多档尺寸,置信错误率低至 4.0%,通过指针头以单次前向传播直接输出校准概率,原生支持 noul、choice...
阅读原文

R2T2

R2T2 是网易有道开源的低延迟真流式语音识别模型,基于 Qwen3-ASR,通过稳定前缀与 Commit/Wait 解码实现已提交文字不回改,平均延迟约 200 至 600 毫秒,支...
阅读原文

SocialCoach

SocialCoach 是香港科技大学(广州)与微软亚洲研究院联合开源的 AI 情商教练,由 Tianfu Wang 开发,内置覆盖 7 大领域的 46 个场景,基于 CASEL 框架与 34 ...
阅读原文

OpenMuse

OpenMuse 是 CopilotKit 开源的 AI 助理,为 Agent 配备 Chromium 浏览器、可选 Linux 容器和文件系统,能处理邮件、PDF、日历、网页监控与财务分析任务,支...
阅读原文

T3PO

T3PO 是网易有道开源的流式同传翻译模型(simulTaneous Translation via pareTo Policy Optimization),以 READ/WRITE 增量决策实现边说边译,用帕累托优化...
阅读原文

Longcat-2.5-preview

Longcat-2.5-preview 是美团发布的新一代模型 LongCat-2.5-Preview:1.6T 总参数、约 48B 激活、1M token 上下文,首次引入原生多模态,最大输出 128K,兼容 ...
阅读原文

Kimu

Kimu(Kimu Studio)是 trykimu 团队开源的 AI 视频编辑器,用自然语言下达指令即可自动生成剪辑、时序与布局,支持无限轨道自由编辑、实时预览、一键导出与...
阅读原文

Spark-ASR-2.0

Spark-ASR-2.0 是科大讯飞最新一代语音识别大模型,基于星火语音基座 Spark-Audio 打造,采用非自回归与 LLM 增强自回归协同架构,支持中英文混合免切换、全...
阅读原文

Ok Work

Ok Work 是百度推出的轻量化 AI 随身办公工具,微信小程序即开即用、无需下载安装,集成 AI PPT、AI 写作、AI 表格、AI 生图四大能力与海量模板,支持文档与 ...
阅读原文

TeleOCR

TeleOCR 是中国电信星辰实验室开源的文档解析模型,采用约 1.2B 参数的轻量级视觉语言架构,在同一个框架内统一处理数字文档与相机拍摄文档,把文字、版面、...
阅读原文

Qwen-Audio-3.1

Qwen-Audio-3.1 是阿里通义千问推出的语音大模型系列,含 ASR、ASR-Next、TTS、TTS-Next、Realtime 五款模型,支持30种语言与16大中文方言,流式首字响应约16...
阅读原文
123…220