融合ChatGPT+DALL·E 3，贾佳亚团队新作开源畅玩：识图推理生图一站解决

AIGC动态2年前 (2024)发布量子位

AIGC动态欢迎阅读

原标题：融合ChatGPT+DALL·E 3，贾佳亚团队新作开源畅玩：识图推理生图一站解决
关键字：模型,图像,数据,图片,能力
文章来源：量子位
内容字数：5415字

内容摘要：

允中发自凹非寺量子位 | 公众号 QbitAI在开源社区中把GPT-4+Dall·E 3能⼒整合起来的模型该有多强？
香港中文大学终身教授贾佳亚团队提出多模态模型Mini-Gemini：
更高清图像的精确理解、更高质量的训练数据、更强的图像解析推理能力，还能结合图像推理和生成，堪称王炸。
Mini-Gemini还提供了2B小杯到34B的超大杯，最强模型在多个指标上相比谷歌的Gemini Pro甚至GPT-4V都不遑多让。
目前，Mini-Gemini从代码、模型到数据已全部开源，登上了PaperWithCode热榜。
Mini-Gemini线上Demo也已发布，超会玩梗，一起来体验下！
接近商业闭源模型水平Mini-Gemini Demo放出后受到广大网友关注，一番“品尝”后，他们认为Mini-Gemini跟商业模型差不了多少。
目前，绝大多数多模态模型仅支持低分辨率图像输入和文字输出，而在实际场景中，许多任务都需要对高清图像进行解析，并用图像的形式进行展现。
如下图所示，Mini-Gemini不仅能够根据图片对做面包的过程进行手把手教学，也能够准确将不同电脑品种根据图片中的各种参

原文链接：融合ChatGPT+DALL·E 3，贾佳亚团队新作开源畅玩：识图推理生图一站解决