标签:多模态学习

AI赚钱副业~AI生成影视解说,半个月涨粉变现3.5W+!

这两年大家都在感叹生活不易,然而我想说的是,机会还是有的,但问题不在于有没有,而在于你是否能够认准机会,然后抓住它。 接触过很多咨询项目的人,发现...

CogView-3-Flash

CogView-3-Flash 是智谱推出的首个免费AI图像生成模型,能根据文本描述生成高审美分数的图像,支持多种分辨率,满足专业领域需求。模型具备创意多样性,基于...
阅读原文

MiniRAG

MiniRAG是香港大学推出的新型检索增强型生成(RAG)系统,专为在资源受限的场景下高效部署小型语言模型(SLMs)设计。MiniRAG基于两个关键技术实现这一目标:...
阅读原文

FlexRAG

FlexRAG 是创新的检索增强生成(RAG)框架,旨在解决传统 RAG 系统在处理长上下文时面临的计算成本高和生成质量不足的问题。通过将检索到的上下文信息压缩成...
阅读原文

什么是视频扩散模型(Video Diffusion Models, VDM)

视频扩散模型(Video Diffusion Models, VDM)是一种结合了变分自编码器(VAE)和扩散模型优势的生成模型。VDM的核心思想是在潜在空间中进行扩散过程,而不是...
阅读原文

田渊栋:2024年年终总结

原标题:田渊栋:2024年年终总结 文章来源:新智元 内容字数:7452字田渊栋2024年AI研究总结及2025年展望 本文总结了田渊栋博士2024年在人工智能领域的研究...
阅读原文

VideoVAE+

VideoVAE+(VideoVAE Plus)是香港科技大学团队推出的先进的跨模态视频变分自编码器(Video VAE),通过引入新的时空分离压缩机制和文本指导,实现了对大幅运...
阅读原文

什么是视觉语言模型(Vision-Language Models, VLMs)

视觉语言模型(Vision-Language Models, VLMs)是一种多模态人工智能系统,它结合了图像和文本的处理能力,以执行高级视觉语言任务,如视觉问答(Visual Ques...
阅读原文

行人、车辆、动物等ReID最新综述!武大等全面总结Transformer方法 | IJCV 2024

原标题:行人、车辆、动物等ReID最新综述!武大等全面总结Transformer方法 | IJCV 2024 文章来源:新智元 内容字数:7928字Transformer在目标重识别 (Re-ID) ...
阅读原文

揭开未来之门:Llama2024年度亮点全解析

原标题:Llama2024年度要点总结 文章来源:人工智能学家 内容字数:7315字2024年Llama项目进展概述 随着2024年的结束,Llama项目在全球范围内取得了显著的进...
阅读原文

DeepSeek 怒抢视觉对话王座!DeepSeek-VL2 发布即开源,技术全公开

原标题:DeepSeek 怒抢视觉对话王座!DeepSeek-VL2 发布即开源,技术全公开 文章来源:夕小瑶科技说 内容字数:6315字DeepSeek-VL2:国内大模型领域的“拼多多...
阅读原文

跨越边界:解密多模态大模型的对齐策略与创新潜力

探索不同的对齐方法对MLLMs性能的影响~
阅读原文

解锁复杂数学推理的秘密:通过多模态慢思考逐步拆解原子步骤

该方法在解决问题的每一步都始终保持着较高的推理质量。
阅读原文
1234