大语言模型

优惠 新型神经网络模型HGRN2:一种在序列建模任务中表现出色的线性递归神经网络(RNN)的改进版本

  • 新型神经网络模型HGRN2:一种在序列建模任务中表现出色的线性递归神经网络(RNN)的改进版本
    AI
  • 上海人工智能实验室推出新型神经网络模型HGRN2(Hierarchically Gated Linear RNNs with State Expansion),它是一种在序列建模任务中表现出色的线性递归神经网络(RNN)的改进版本。HGRN2的设计灵感来自于线性注意力机制,通过一种称为外积(outer product)... 阅读全文

    优惠 新型网络代理WILBUR:能够与网站互动的智能系统

  • 新型网络代理WILBUR:能够与网站互动的智能系统
    AI
  • 来自加州大学伯克利分校和旧金山分校的研究人员推出新型网络代理(Web Agent)WILBUR,它是一种能够与网站互动的智能系统。例如,你在网购时,需要在众多商品中找到一款价格合适、评价高的运动鞋。通常,这需要你手动浏览网页、筛选条件并进行比较。而WILBUR就像一个虚拟的购物助手,能够理解你的需求,并自动在网站上为你... 阅读全文

    优惠 谷歌推出新型注意力机制Infini-attention:可以使基于Transformer的大语言模型高效地处理无限长的输入序列,同时保持内存和计算资源的有限性

  • 谷歌推出新型注意力机制Infini-attention:可以使基于Transformer的大语言模型高效地处理无限长的输入序列,同时保持内存和计算资源的有限性
    AI
  • 谷歌推出新型注意力机制Infini-attention,它可以使基于Transformer的大语言模型(LLMs)高效地处理无限长的输入序列,同时保持内存和计算资源的有限性。例如,就像有一个超级大脑,它可以阅读和记住一本无限长的书,并且能够快速准确地回忆起书中的任何信息,不管这些信息在书的哪个位置。 主要功能和特点: ... 阅读全文

    优惠 新基准测试RULER:更全面地评估长上下文语言模型的性能

  • 新基准测试RULER:更全面地评估长上下文语言模型的性能
    AI
  • 英伟达推出新基准测试RULER,它旨在更全面地评估长上下文语言模型(Long-Context LMs)的性能。想象一下,你有一个超级聪明的助手,它可以阅读和理解非常长的文本,比如整本书或大量的文章,并且能够记住所有的细节,以便在需要时找到特定的信息。这就是长上下文语言模型尝试做的事情,而RULER就是用来测试这些模型是... 阅读全文

    优惠 了如何将原本设计用于大语言模型的解码器结构,适配到计算机视觉领域

  • 了如何将原本设计用于大语言模型的解码器结构,适配到计算机视觉领域
    AI
  • 来自香港大学、上海人工智能实验室和清华大学深圳国际研究生院的研究人员发布论文探讨了如何将原本设计用于大型语言模型(LLMs)的解码器(Decoder)结构,如LLaMA,适配到计算机视觉领域。想象一下,你有一个能够理解文字的智能系统,现在研究者们想要让这个系统不仅能读懂文字,还能“看懂”图片。这就是他们尝试将LLaMA... 阅读全文

    优惠 新型视觉-语言模型BRAVE:扩展和增强VLM在处理图像和语言任务时的视觉编码能力

  • 新型视觉-语言模型BRAVE:扩展和增强VLM在处理图像和语言任务时的视觉编码能力
    AI
  • 谷歌和洛桑瑞士联邦理工学院推出新型视觉-语言模型BRAVE,它的核心目标是扩展和增强VLM在处理图像和语言任务时的视觉编码能力。想象一下,如果你给BRAVE一个描述,比如“一只蝴蝶停在花上”,它不仅能够理解这个描述,还能从成千上万的图片中找到与描述最匹配的图像,甚至在没有明确指示的情况下回答关于图像的问题,例如回答“蝴... 阅读全文

    优惠 MA-LMM:更有效地理解长期视频内容而设计的记忆增强型大型多模态模型

  • MA-LMM:更有效地理解长期视频内容而设计的记忆增强型大型多模态模型
    AI
  • Meta推出MA-LMM,它是一个为了更有效地理解长期视频内容而设计的记忆增强型大型多模态模型。与传统的视频理解模型不同,MA-LMM采用了一种在线处理视频帧的方式,并使用一个记忆库来存储过去的视频信息。这样,即使视频非常长,模型也能够引用历史视频内容进行长期分析,而不会超出大型语言模型(LLMs)的上下文长度限制或G... 阅读全文

    优惠 苹果推出Ferret-UI:专门为理解和交互移动用户界面(UI)屏幕而设计的多模态大语言模型

  • 苹果推出Ferret-UI:专门为理解和交互移动用户界面(UI)屏幕而设计的多模态大语言模型
    AI
  • 苹果推出Ferret-UI,它是一种专门为理解和交互移动用户界面(UI)屏幕而设计的多模态大语言模型(MLLM)。Ferret-UI旨在提高对移动UI屏幕的理解能力,具备引用、定位和推理等能力。与一般领域的MLLM相比,这些模型在理解和与UI屏幕有效交互方面往往存在不足。例如,如果用户想要在手机上预订餐厅,Ferret... 阅读全文

    优惠 针对长视频理解的视频-大语言模型Koala:帮助模型理解长达数分钟的视频内容,并能够回答关于视频的问题

  • 针对长视频理解的视频-大语言模型Koala:帮助模型理解长达数分钟的视频内容,并能够回答关于视频的问题
    AI
  • 来自波士顿大学、中国电子科技大学和Adobe Research的研究人员推出Koala,它是一种针对长视频理解的视频-大语言模型(Video-Large Language Model,简称vLLM)。Koala的目标是帮助模型理解长达数分钟的视频内容,并能够回答关于视频的问题。这在技术上是一个挑战,因为长视频涉及识别一... 阅读全文

    优惠 浦语·灵笔2系列新模型InternLM-XComposer2-4KHD:在处理图像和文本方面有着显著的进步

  • 浦语·灵笔2系列新模型InternLM-XComposer2-4KHD:在处理图像和文本方面有着显著的进步
    AI
  • 上海人工智能实验室推出浦语·灵笔2系列新模型InternLM-XComposer2-4KHD,这是一款开创性大型视觉-语言模型(LVLM),这个模型在处理图像和文本方面有着显著的进步。例如,你有一个能够理解图片内容并回答有关图片问题的智能助手,这就是这个模型的基本功能。InternLM-XComposer2-4KHD是... 阅读全文

    优惠 LLM2Vec:将大型的解码器模型转换成强大的文本编码器

  • LLM2Vec:将大型的解码器模型转换成强大的文本编码器
    AI
  • 这篇论文介绍了一个名为LLM2Vec的方法,它能够将大型的解码器模型(decoder-only LLMs)转换成强大的文本编码器。这些解码器模型在很多自然语言处理(NLP)任务中都是最先进的,但在文本嵌入任务中,它们的能力还没有得到充分利用。文本嵌入任务需要模型能够生成丰富的上下文化表示,而传统的解码器模型由于其单向(... 阅读全文

    优惠 SambaLingo:针对大语言模型进行多语言适应性调整的研究项目

  • SambaLingo:针对大语言模型进行多语言适应性调整的研究项目
    AI
  • 这篇论文的主题是“SambaLingo”,这是一个针对大型语言模型(LLMs)进行多语言适应性调整的研究项目。简单来说,SambaLingo的目标是让大型语言模型能够理解和生成更多不同语言的文本,弥补目前LLMs在多种语言能力上的差距。例如,如果我们要为一个以英语为中心的模型添加对阿拉伯语的支持,SambaLingo的... 阅读全文