AI

优惠 新型视觉-语言模型BRAVE:扩展和增强VLM在处理图像和语言任务时的视觉编码能力

  • 新型视觉-语言模型BRAVE:扩展和增强VLM在处理图像和语言任务时的视觉编码能力
    AI
  • 谷歌和洛桑瑞士联邦理工学院推出新型视觉-语言模型BRAVE,它的核心目标是扩展和增强VLM在处理图像和语言任务时的视觉编码能力。想象一下,如果你给BRAVE一个描述,比如“一只蝴蝶停在花上”,它不仅能够理解这个描述,还能从成千上万的图片中找到与描述最匹配的图像,甚至在没有明确指示的情况下回答关于图像的问题,例如回答“蝴... 阅读全文

    优惠 创新框架DreamScene360:根据文本提示生成360度全景的3D场景

  • 创新框架DreamScene360:根据文本提示生成360度全景的3D场景
    AI
  • 加州大学洛杉矶分校、德克萨斯大学奥斯汀分校和DEVCOM ARL的研究人员推出创新框架DreamScene360,它能够根据文本提示生成360度全景的3D场景。例如,如果你只需要描述一个场景,比如“一个有瀑布的优胜美地国家公园”,DreamScene360就能够创建出一个全方位的、可以自由探索的3D环境。这就是它的神奇... 阅读全文

    优惠 Suno的竞争对手出现了!前谷歌 DeepMind创立的Udio正式上线,免费用户每月可以生成1200首歌

  • Suno的竞争对手出现了!前谷歌 DeepMind创立的Udio正式上线,免费用户每月可以生成1200首歌
    AI
  • Suno的竞争对手出现了!由前谷歌 DeepMind 的领先 AI 研究员和工程师创立的Udio正式上线,目前处于免费测试阶段,用户每月可以生成1200首歌。相比Suno,Udio生成的歌曲时长更长,人声更加优质,偏向于模仿真实的歌手。不过目前由于使用人数过多,网站处于报错状态,大家可以明后天再进行测试。 官方介绍: ... 阅读全文

    优惠 MA-LMM:更有效地理解长期视频内容而设计的记忆增强型大型多模态模型

  • MA-LMM:更有效地理解长期视频内容而设计的记忆增强型大型多模态模型
    AI
  • Meta推出MA-LMM,它是一个为了更有效地理解长期视频内容而设计的记忆增强型大型多模态模型。与传统的视频理解模型不同,MA-LMM采用了一种在线处理视频帧的方式,并使用一个记忆库来存储过去的视频信息。这样,即使视频非常长,模型也能够引用历史视频内容进行长期分析,而不会超出大型语言模型(LLMs)的上下文长度限制或G... 阅读全文

    优惠 苹果推出Ferret-UI:专门为理解和交互移动用户界面(UI)屏幕而设计的多模态大语言模型

  • 苹果推出Ferret-UI:专门为理解和交互移动用户界面(UI)屏幕而设计的多模态大语言模型
    AI
  • 苹果推出Ferret-UI,它是一种专门为理解和交互移动用户界面(UI)屏幕而设计的多模态大语言模型(MLLM)。Ferret-UI旨在提高对移动UI屏幕的理解能力,具备引用、定位和推理等能力。与一般领域的MLLM相比,这些模型在理解和与UI屏幕有效交互方面往往存在不足。例如,如果用户想要在手机上预订餐厅,Ferret... 阅读全文

    优惠 针对长视频理解的视频-大语言模型Koala:帮助模型理解长达数分钟的视频内容,并能够回答关于视频的问题

  • 针对长视频理解的视频-大语言模型Koala:帮助模型理解长达数分钟的视频内容,并能够回答关于视频的问题
    AI
  • 来自波士顿大学、中国电子科技大学和Adobe Research的研究人员推出Koala,它是一种针对长视频理解的视频-大语言模型(Video-Large Language Model,简称vLLM)。Koala的目标是帮助模型理解长达数分钟的视频内容,并能够回答关于视频的问题。这在技术上是一个挑战,因为长视频涉及识别一... 阅读全文

    优惠 基于文本编辑NeRF(神经辐射场)场景DATENeRF:从2D图像中重建3D场景

  • 基于文本编辑NeRF(神经辐射场)场景DATENeRF:从2D图像中重建3D场景
    AI
  • Adob​​e推出DATENeRF,它用于基于文本编辑NeRF(神经辐射场)场景。NeRF是一种可以创建和渲染3D环境的技术,它通过从2D图像中重建场景的3D表示来实现。DATENeRF的关键特点是它能够利用场景的深度信息来指导基于文本的图像编辑,从而在保持视角一致性的同时,实现更真实和详细的编辑结果。 例如,如果你有... 阅读全文

    优惠 浦语·灵笔2系列新模型InternLM-XComposer2-4KHD:在处理图像和文本方面有着显著的进步

  • 浦语·灵笔2系列新模型InternLM-XComposer2-4KHD:在处理图像和文本方面有着显著的进步
    AI
  • 上海人工智能实验室推出浦语·灵笔2系列新模型InternLM-XComposer2-4KHD,这是一款开创性大型视觉-语言模型(LVLM),这个模型在处理图像和文本方面有着显著的进步。例如,你有一个能够理解图片内容并回答有关图片问题的智能助手,这就是这个模型的基本功能。InternLM-XComposer2-4KHD是... 阅读全文

    优惠 LLM2Vec:将大型的解码器模型转换成强大的文本编码器

  • LLM2Vec:将大型的解码器模型转换成强大的文本编码器
    AI
  • 这篇论文介绍了一个名为LLM2Vec的方法,它能够将大型的解码器模型(decoder-only LLMs)转换成强大的文本编码器。这些解码器模型在很多自然语言处理(NLP)任务中都是最先进的,但在文本嵌入任务中,它们的能力还没有得到充分利用。文本嵌入任务需要模型能够生成丰富的上下文化表示,而传统的解码器模型由于其单向(... 阅读全文

    优惠 SambaLingo:针对大语言模型进行多语言适应性调整的研究项目

  • SambaLingo:针对大语言模型进行多语言适应性调整的研究项目
    AI
  • 这篇论文的主题是“SambaLingo”,这是一个针对大型语言模型(LLMs)进行多语言适应性调整的研究项目。简单来说,SambaLingo的目标是让大型语言模型能够理解和生成更多不同语言的文本,弥补目前LLMs在多种语言能力上的差距。例如,如果我们要为一个以英语为中心的模型添加对阿拉伯语的支持,SambaLingo的... 阅读全文

    优惠 CodecLM:用于生成与特定指令分布和大语言模型对齐的高质量合成数据的通用框架

  • CodecLM:用于生成与特定指令分布和大语言模型对齐的高质量合成数据的通用框架
    AI
  • 谷歌云和搜索团队推出CodecLM,它是一个用于生成与特定指令分布和大语言模型(LLMs)对齐的高质量合成数据的通用框架。简单来说,CodecLM就像是一个智能的数据制造工厂,能够根据需要生产出适合训练语言模型的数据。例如,如果我们想要训练一个语言模型来更好地回答关于健康和营养的问题,CodecLM可以生成一系列与健康... 阅读全文

    优惠 大语言模型在处理表格数据时的记忆力和学习能力

  • 大语言模型在处理表格数据时的记忆力和学习能力
    AI
  • 图宾根大学图宾根人工智能中心和微软搜索团队发布论文探讨大语言模型(Large Language Models,简称LLMs)在处理表格数据时的记忆力和学习能力。用通俗的语言来说,就像是研究一个学习了很多知识的智能助手,当它遇到新的或之前学过的问题时,它是如何回忆和应用这些知识的。 主要功能和特点: 记忆力测试: 研究者... 阅读全文