AI工具

AI浏览器助手,实时分析浏览器内容、提供建议和自动撰写邮件等功能

TwinMind 是智能AI侧边栏助手,基于理解用户的视觉和听觉输入提升工作效率。支持无缝集成至用户喜爱的平台,提供实时转录和内容理解功能。TwinMind强调隐私保...
阅读原文

AI英文论文写作工具,百万篇学术文献训练而成

Paperpal是AI英文写作工具,集成了语言编辑、文本改写与生成、投稿检查等核心功能,基于经过数百万篇已发表学术文章训练的AI技术,提供实时、特定学科的语言...
阅读原文

阿里开源的语音生成大模型

CosyVoice 2.0 是阿里巴巴通义实验室推出的CosyVoice语音生成大模型升级版,模型用有限标量量化技术提高码本利用率,简化文本-语音语言模型架构,推出块感知...
阅读原文

AI内容整理和创作平台,快速从网页、视频、播客等来源中提取信息

YouMind是AI驱动的内容整理和创作平台,支持用户从网页、视频、播客等多种来源中提取和保存信息,并将信息转化为创意作品。YouMind基于Anthropic、OpenAI和Me...
阅读原文

AI视频创作平台,从文案、分镜脚本、编辑的全流程AI赋能

ShowBiz AI 是当虹科技推出的专业级AI视频创作平台,基于BlackEye多模态视听大模型,专为视频创作而设计。ShowBiz AI具备文本转动画的能力,简化动画制作流程...
阅读原文

无问芯穹开源的端侧全模态理解模型

Megrez-3B-Omni是无问芯穹推出的全球首个端侧全模态理解开源模型,能处理图像、音频和文本三种模态数据。Megrez-3B-Omni在多个主流测试集上展现出超越34B模型...
阅读原文

无需微调的推理框架,提升扩散模型生成能力首次实现8K分辨率图像

FreeScale是南洋理工大学、阿里巴巴集团和复旦大学推出无需微调的推理框架,提升预训练扩散模型生成高分辨率图像和视频的能力。FreeScale基于处理和融合不同...
阅读原文

西工大联合微软和香港大学推出的说唱乐生成模型

Freestyler是西北工业大学计算机科学学院音频、语音与语言处理小组(ASLP@NPU)、微软及香港中文大学深圳研究院大数据研究所共同推出的说唱乐生成模型,能直...
阅读原文

Snap联合港科大等机构推出的移动端文生图模型

SnapGen是Snap Inc、香港科技大学、墨尔本大学等机构联合推出的文本到图像(T2I)扩散模型,能在移动设备上快速生成高分辨率(1024x1024像素)的图像,且只需...
阅读原文

kimi推出的 k1 系列强化学习模型

k1 视觉思考模型是kimi推出的k1系列强化学习AI模型,原生支持端到端图像理解和思维链技术,将能力扩展到数学之外的更多基础科学领域。k1模型在图像理解、数学...
阅读原文

PhonicMind:智能音乐分离平台助你轻松提取人声、鼓、贝斯及乐器音轨

PhonicMind是在线AI音乐处理平台,专注于从歌曲中提取和分离人声、乐器等音频元素。基于先进的AI技术,为用户提供精确的人声移除和音乐隔离功能,支持制作卡...
阅读原文

360 推出国产自研 AI 大模型,多项评测优于GPT-4o

360gpt2-o1 是 360 自研的 AI 大模型,在推理能力上有显著提升,特别是在数学和逻辑推理任务上表现出色。模型通过合成数据优化、模型后训练和“慢思考”范式实...
阅读原文

腾讯微信推出的多模态大模型

POINTS 1.5 是腾讯微信发布的多模态大模型,是POINTS 1.0的升级版本。 模型继续沿用了POINTS 1.0中的LLaVA架构,由一个视觉编码器、一个投影器和一个大型语言...
阅读原文

Slides Orator:AI驱动的虚拟解说平台实现幻灯片内容的即时生动呈现

Slides Orator是创新的AI平台,基于创建虚拟形象实时展示幻灯片进行解说。工具基于技术生成语音旁白,让演示内容动态地与观众互动,增强演示的吸引力和参与度...
阅读原文

Step-1o:国内首个千亿参数端到端语音大模型震撼发布,性提升语音识别与合成能力

Step-1o是阶跃星辰推出的国内首个千亿参数端到端语音大模型。模型支持语音、文本等混合形式的输入和输出,可以快速反应并随时打断,提供最便捷的互动体验;同...
阅读原文
11213141516137