衡阳派盒市场营销有限公司

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會員中心
創(chuàng)作中心

完善資料讓更多小伙伴認識你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

如何在多模態(tài)的語境中利用Transformer強大的表達能力?

深度學(xué)習(xí)自然語言處理 ? 來源:夕小瑤的賣萌屋 ? 作者:子龍 ? 2021-03-29 16:47 ? 次閱讀

曾幾何時,多模態(tài)預(yù)訓(xùn)練已經(jīng)不是一個新的話題,各大頂會諸多論文仿佛搭上Visual和BERT,就能成功paper+=1,VisualBERT、ViLBERT層出不窮,傻傻分不清楚。..。..這些年NLPer在跨界上忙活的不亦樂乎,提取視覺特征后和文本詞向量一同輸入到萬能的Transformer中,加大力度預(yù)訓(xùn)練,總有意想不到的SOTA。

如何在多模態(tài)的語境中更細致準確地利用Transformer強大的表達能力呢?Facebook最新的 Transformer is All You Need 也許可以給你答案。

a12e796a-8e8f-11eb-8b86-12bb97331649.png

這篇貌似標(biāo)題黨的文章開宗明義,針對文本+視覺的多模態(tài)任務(wù),用好Transformer就夠了,與許多前作不同,這次提出的模型一個模型可以解決多個任務(wù):目標(biāo)檢測、自然語言理解、視覺問答,各個模型板塊各司其職、條理清晰:視覺編碼器、文本編碼器、特征融合解碼器,都是建立在多層Transformer之上,最后添加為每個任務(wù)設(shè)計的處理器,通過多任務(wù)訓(xùn)練,一舉刷新了多個任務(wù)的榜單。

a1a44924-8e8f-11eb-8b86-12bb97331649.png

文本編碼器用Transformer提取文本特征是個老生常談的問題,從BERT石破天驚開始,純文本領(lǐng)域近乎已被Transformer蠶食殆盡,所以該文也不能免俗,直接借用BERT的結(jié)構(gòu)提取文本內(nèi)容,區(qū)別在于,為了解決多個任務(wù),在文本序列前添加了一個針對不同任務(wù)的參數(shù)向量,在最后輸出隱藏狀態(tài)到解碼器時再去掉。

視覺編碼器本文將Transformer強大的表達能力運用到視覺特征的提取中,由于圖片像素點數(shù)量巨大,首先通過基于卷積神經(jīng)網(wǎng)絡(luò)的ResNet-50提取卷積特征,極大程度上地降低了特征數(shù)量,最終得到的feature map大小為,然后用全聯(lián)接層調(diào)整單個特征的維度到,再利用多層Transformer中的注意力機制提取各個feature之間的關(guān)系,由于Transformer的輸入是序列,文章將拉成一條長為的序列,另外和文本編碼器類似,同樣添加了與下游任務(wù)相關(guān)的。

其中是調(diào)整維度的全聯(lián)接層,是多層Transformer編碼器。

模態(tài)融合解碼器多模態(tài)的關(guān)鍵之一就在于怎么同時利用多個模態(tài),在本文中是通過Transformer的解碼器實現(xiàn)的,這個解碼器首先將任務(wù)相關(guān)的query做self-attention,再將結(jié)果與文本編碼器和視覺編碼器的結(jié)果做cross-attention,針對單一模態(tài)的任務(wù),選取對應(yīng)編碼器的輸出即可,針對多模態(tài)的任務(wù),取兩個編碼器輸出的拼接。

任務(wù)處理器(task-specific output head)之前多模態(tài)預(yù)訓(xùn)練模型往往只針對某一項任務(wù),而本文提出的一個模型可以解決多個文本+視覺任務(wù),與BERT可以解決多個文本任務(wù)類似,本文的模型在模態(tài)融合解碼器的結(jié)果上添加為每個任務(wù)設(shè)計的處理器,這個處理器相對簡單,用于從隱藏狀態(tài)中提取出與特定任務(wù)相匹配的特征。

目標(biāo)檢測:添加box_head和class_head兩個前饋神經(jīng)網(wǎng)絡(luò)從最后一層隱藏狀態(tài)中提取特征用來確定目標(biāo)位置和預(yù)測目標(biāo)類型。

自然語言理解、視覺問答:通過基于全聯(lián)接層的分類模型實現(xiàn),將模態(tài)融合解碼器結(jié)果的第一位隱藏狀態(tài)輸入到兩層全聯(lián)接層并以GeLU作為激活函數(shù),最后計算交叉熵損失。

實驗與總結(jié)本文提出的多模態(tài)預(yù)訓(xùn)練模型各個板塊劃分明確,通過多層Transformer分別提取特征,再利用解碼器機制融合特征并完成下游任務(wù),同時借助最后一層任務(wù)相關(guān)的處理器,可以通過一個模型解決多個任務(wù),同時也讓多任務(wù)預(yù)訓(xùn)練成為可能,并在實驗中的各個數(shù)據(jù)集上得到了論文主要進行了兩部分實驗:

多任務(wù)學(xué)習(xí):

這里的多任務(wù)涉及目標(biāo)檢測和視覺問答兩個任務(wù),在目標(biāo)檢測上運用COCO和VG兩個數(shù)據(jù)集,在視覺問答上運用VQAv2數(shù)據(jù)集。對比了單一任務(wù)和多任務(wù)同時訓(xùn)練的結(jié)果,同時對比了不同任務(wù)共用解碼器的結(jié)果。

a1f97444-8e8f-11eb-8b86-12bb97331649.png

從結(jié)果中我們可以看出,單純的使用多任務(wù)訓(xùn)練并不一定可以提高結(jié)果,不同任務(wù)間雖然相關(guān)但是卻不完全相同,這可能是任務(wù)本身差異或者數(shù)據(jù)集的特性所導(dǎo)致,第二行和第五行可以很明顯地看出COCO上的目標(biāo)檢測和VQAv2的視覺問答相結(jié)合后,結(jié)果有顯著的下降,然而VG上的目標(biāo)檢測卻能夠和視覺問答很好地結(jié)合,通過三個數(shù)據(jù)集上的共同訓(xùn)練,可以得到最高的結(jié)果。

多模態(tài)學(xué)習(xí):

這一實驗中,為了體現(xiàn)所提出模型能夠有效解決多個多種模態(tài)的不同任務(wù),論文作者在之前COCO、VG、VQAv2的基礎(chǔ)上,增加了單一文本任務(wù)GLUE的幾個數(shù)據(jù)集(QNLI、QQP、MNLI、SST-2)和視覺推斷數(shù)據(jù)集SNLI-VE,從數(shù)據(jù)集的數(shù)量上可以看出本文模型的全能性。與本文對比的有純文本的BERT、基于Transformer的視覺模型DETR、多模態(tài)預(yù)訓(xùn)練模型VisualBERT。

a2736164-8e8f-11eb-8b86-12bb97331649.png

仔細看各個數(shù)據(jù)集上的結(jié)果,不難看出本文提出的模型其實并不能在所有數(shù)據(jù)集多上刷出SOTA,比如COCO上遜色于DETR,SNLI-VE遜色于VisualBERT,SST-2遜色于BERT,其他數(shù)據(jù)集上都有一定的提高,但是模型卻勝在一個“全”字,模型的結(jié)構(gòu)十分清晰明了,各個板塊的作用十分明確,同時針對不同任務(wù)的處理器也對后續(xù)多模態(tài)任務(wù)富有啟發(fā)性。

原文標(biāo)題:【Transformer】沒有什么多模態(tài)任務(wù)是一層Transformer解決不了的!

文章出處:【微信公眾號:深度學(xué)習(xí)自然語言處理】歡迎添加關(guān)注!文章轉(zhuǎn)載請注明出處。

責(zé)任編輯:haq

聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問題,請聯(lián)系本站處理。 舉報投訴
  • 編碼器
    +關(guān)注

    關(guān)注

    45

    文章

    3669

    瀏覽量

    135251
  • Transforme
    +關(guān)注

    關(guān)注

    0

    文章

    12

    瀏覽量

    8797
  • 多模
    +關(guān)注

    關(guān)注

    1

    文章

    28

    瀏覽量

    10894

原文標(biāo)題:【Transformer】沒有什么多模態(tài)任務(wù)是一層Transformer解決不了的!

文章出處:【微信號:zenRRan,微信公眾號:深度學(xué)習(xí)自然語言處理】歡迎添加關(guān)注!文章轉(zhuǎn)載請注明出處。

收藏 人收藏

    評論

    相關(guān)推薦

    2025年Next Token Prediction范式會統(tǒng)一模態(tài)

    訓(xùn)練方法與推理策略 性能評測體系 現(xiàn)存挑戰(zhàn)與未來方向 綜述的完整目錄如下: 模態(tài)的 Tokenization 我們認為模態(tài)的 Tokenization 是 MMNTP 的基石和最重
    的頭像 發(fā)表于 01-21 10:11 ?68次閱讀
    2025年Next Token Prediction范式會統(tǒng)一<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>嗎

    體驗MiniCPM-V 2.6 模態(tài)能力

    模態(tài)組網(wǎng)
    jf_23871869
    發(fā)布于 :2025年01月20日 13:40:48

    【「具身智能機器人系統(tǒng)」閱讀體驗】2.具身智能機器人大模型

    模態(tài)融合的創(chuàng)新與突破 機器人控制技術(shù)的另一個重要突破在于模態(tài)大模型的應(yīng)用。相比于僅通過文字進行人機交互的傳統(tǒng)方法,現(xiàn)代機器人能夠融合視覺、聲音、定位等
    發(fā)表于 12-29 23:04

    商湯日日新模態(tài)大模型權(quán)威評測第一

    剛剛,商湯科技日日新SenseNova模態(tài)大模型,在權(quán)威綜合評測權(quán)威平臺OpenCompass的模態(tài)評測取得榜單第一。
    的頭像 發(fā)表于 12-20 10:39 ?351次閱讀

    使用ReMEmbR實現(xiàn)機器人推理與行動能力

    視覺語言模型(VLM)通過將文本和圖像投射到同一個嵌入空間,將基礎(chǔ)大語言模型(LLM)強大的語言理解能力與視覺 transformer(ViT)的視覺能力相結(jié)合。VLM 可以處理非結(jié)構(gòu)
    的頭像 發(fā)表于 11-19 15:37 ?349次閱讀
    使用ReMEmbR實現(xiàn)機器人推理與行動<b class='flag-5'>能力</b>

    未來AI大模型的發(fā)展趨勢

    上得到了顯著提升。未來,算法和架構(gòu)的進一步優(yōu)化將推動AI大模型在性能上實現(xiàn)新的突破。 多頭自注意力機制、前饋神經(jīng)網(wǎng)絡(luò)等關(guān)鍵技術(shù)的改進,將增強模型的表達能力和泛化能力。 模態(tài)融合 :
    的頭像 發(fā)表于 10-23 15:06 ?854次閱讀

    利用OpenVINO部署Qwen2模態(tài)模型

    模態(tài)大模型的核心思想是將不同媒體數(shù)據(jù)(如文本、圖像、音頻和視頻等)進行融合,通過學(xué)習(xí)不同模態(tài)之間的關(guān)聯(lián),實現(xiàn)更加智能化的信息處理。簡單來說,模態(tài)
    的頭像 發(fā)表于 10-18 09:39 ?552次閱讀

    云知聲山海模態(tài)大模型UniGPT-mMed登頂MMMU測評榜首

    近日,模態(tài)人工智能模型基準評測集MMMU更新榜單,云知聲山海模態(tài)大模型UniGPT-mMed以通用能力、醫(yī)療專業(yè)
    的頭像 發(fā)表于 10-12 14:09 ?340次閱讀
    云知聲山海<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>大模型UniGPT-mMed登頂MMMU測評榜首

    【《大語言模型應(yīng)用指南》閱讀體驗】+ 基礎(chǔ)知識學(xué)習(xí)

    習(xí)語言的表達方式和生成能力。通過預(yù)測文本缺失的部分或下一個詞,模型逐漸掌握語言的規(guī)律和特征。 常用的模型結(jié)構(gòu) Transformer架構(gòu):大語言模型通常基于
    發(fā)表于 08-02 11:03

    科普講座 | 讓AIGC提高你的專業(yè)表達和創(chuàng)作能力

    的專題講座,激發(fā)工程師專業(yè)文章創(chuàng)作靈感,提高個人的專業(yè)表達能力,從而在電力電子領(lǐng)域展現(xiàn)更加卓越的才華!舉辦時間7月2日1900講座內(nèi)容:技術(shù):AIGC時代到來方法:讓A
    的頭像 發(fā)表于 06-23 08:14 ?379次閱讀
    科普講座 | 讓AIGC提高你的專業(yè)<b class='flag-5'>表達</b>和創(chuàng)作<b class='flag-5'>能力</b>

    智源研究院揭曉大模型測評結(jié)果,豆包與百川智能大模型表現(xiàn)優(yōu)異

    模態(tài)理解圖文問答任務(wù),開源和閉源模型表現(xiàn)相當(dāng),而國產(chǎn)模型則表現(xiàn)出色。此外,在中文語境下的文生圖能力方面,國產(chǎn)
    的頭像 發(fā)表于 05-20 09:26 ?856次閱讀

    阿里云通義大模型助力“小愛同學(xué)”強化模態(tài)AI生成能力

    小米的人工智能助手“小愛同學(xué)”近期與阿里云通義大模型達成戰(zhàn)略合作,共同提升其模態(tài)AI生成能力,特別是在圖片生成與理解方面。這次合作不僅將強化“小愛同學(xué)”的功能,還將在小米的多個產(chǎn)品線,包括小米汽車和手機等設(shè)備上得到實際應(yīng)用。
    的頭像 發(fā)表于 05-13 09:19 ?938次閱讀

    商湯科技發(fā)布5.0模態(tài)大模型,綜合能力全面對標(biāo)GPT-4 Turbo

    商湯科技發(fā)布5.0模態(tài)大模型,綜合能力全面對標(biāo)GPT-4 Turbo 4月23日,商湯科技董事長兼CEO徐立在2024商湯技術(shù)交流日上發(fā)布了行業(yè)首個云、端、邊全棧大模型產(chǎn)品矩陣,能夠滿足不同規(guī)模
    的頭像 發(fā)表于 04-24 16:49 ?1179次閱讀

    李未可科技正式推出WAKE-AI模態(tài)AI大模型

    李未可科技模態(tài) AI 大模型正式發(fā)布,積極推進 AI 在終端的場景應(yīng)用 ? 4月18日,2024國生成式AI大會上李未可科技正式發(fā)布為眼鏡等未來終端定向優(yōu)化等自研WAKE-AI
    發(fā)表于 04-18 17:01 ?661次閱讀
    李未可科技正式推出WAKE-AI<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>AI大模型

    【有獎】 百度智能云度目推出首款模態(tài) AI 模組,應(yīng)用場景有獎?wù)骷?/a>

    具備AI圖文理解、語音喚醒、智能輪對話等能力 數(shù)據(jù)處理能力強大,分析速度快,二次開發(fā)高度集成易用 點擊視頻可看度目LUCA互動表現(xiàn) 度目模態(tài)
    的頭像 發(fā)表于 02-26 15:19 ?584次閱讀
    云顶国际| gt百家乐平台| 皇冠足球网| 百家乐最佳投注法下载| 百家乐官网视频看不到| 百家乐博弈之赢者理论坛| 澳门百家乐官网现场真人版| 澳门太阳城娱乐城| 百家乐官网规则| 太和县| 广州百家乐桌子| 百家乐官网娱乐平台官网网| 在线博弈游戏| 百家乐扑克片礼服| 博彩百家乐官网在线| 大发888 大发国际| 川宜百家乐软件| 百家乐官网波音平台开户导航 | 大发888娱乐城送白菜| 24山风水发几房| 实战百家乐官网博彩正网| 菲利宾百家乐现场| 百家乐官网庄闲和的概率| 保亭| 威尼斯人娱乐城注册送彩金| 真人百家乐来博| 太阳城百家乐官网下载网址| 澳门顶级赌场国际| 百家乐详情| 豪享博百家乐官网的玩法技巧和规则| 黄金城娱乐城| 基础百家乐博牌规| 百家乐有无规律可循| 百家乐官网公式书| 久治县| 大发888娱乐城维护| 太阳城百家乐娱乐开户| 澳门百家乐官网娱乐网| 木兰县| 顶级赌场 官方直营网| 澳门百家乐心|