﻿<?xml version="1.0" encoding="utf-8"?>
<ArticleSet>
  <ARTICLE>
    <Journal>
      <PublisherName>مرکز منطقه ای اطلاع رسانی علوم و فناوری</PublisherName>
      <JournalTitle>فصلنامه فناوری اطلاعات و ارتباطات ایران</JournalTitle>
      <ISSN>2717-0411</ISSN>
      <Volume>68</Volume>
      <Issue>68</Issue>
      <PubDate PubStatus="epublish">
        <Year>2026</Year>
        <Month>4</Month>
        <Day>19</Day>
      </PubDate>
    </Journal>
    <ArticleTitle>A Systematic Review of Trustworthiness, Hallucination, and Safety in Large Vision-Language Models</ArticleTitle>
    <VernacularTitle>مروری سیستماتیک بر قابلیت اعتماد، توهم و ایمنی در مدل‌های بزرگ بینایی-زبان</VernacularTitle>
    <FirstPage></FirstPage>
    <LastPage></LastPage>
    <ELocationID EIdType="doi" />
    <Language>fa</Language>
    <AuthorList>
      <Author>
        <FirstName> حانیه</FirstName>
        <LastName> نادری</LastName>
        <Affiliation>دانشگاه صنعتی شریف</Affiliation>
      </Author>
      <Author>
        <FirstName></FirstName>
        <LastName></LastName>
        <Affiliation>دانشگاه تهران</Affiliation>
      </Author>
    </AuthorList>
    <History PubStatus="received">
      <Year>2026</Year>
      <Month>4</Month>
      <Day>18</Day>
    </History>
    <Abstract>&lt;p style="text-align: left;"&gt;Large Vision&amp;ndash;Language Models (LVLMs), despite their remarkable progress in multimodal tasks, continue to face two fundamental reliability challenges: the generation of hallucinatory content inconsistent with visual evidence, and vulnerability to adversarial attacks that bypass safety mechanisms. This systematic review, conducted in accordance with the PRISMA 2020 reporting framework and based on 31 selected studies from 2023 to 2025, investigates the technical roots of hallucination across multiple levels (object, attribute, relation, and narrative), visual jailbreak mechanisms, and mitigation strategies at both training and inference stages.&lt;/p&gt;
&lt;p style="text-align: left;"&gt;The findings indicate that over-reliance on linguistic priors is a common underlying factor behind many hallucination errors and safety failures, and that purely text-based alignment is insufficient for multimodal systems. Furthermore, a significant gap exists between current evaluation capabilities and the real-world complexity of vulnerabilities, hindering comprehensive reliability assessment.&lt;/p&gt;
&lt;p style="text-align: left;"&gt;This review provides an integrated taxonomy of vulnerabilities and outlines a research roadmap, offering a structured foundation for the development of more reliable vision&amp;ndash;language models.&lt;/p&gt;</Abstract>
    <OtherAbstract Language="FA">&lt;p&gt;مدل&amp;zwnj;های بزرگ بینایی-زبان با وجود پیشرفت&amp;zwnj;های چشمگیر در وظایف چندوجهی، همچنان با دو چالش بنیادین قابلیت اعتماد روبه&amp;zwnj;رو هستند: تولید محتوای توهمی ناسازگار با شواهد بصری، و آسیب&amp;zwnj;پذیری در برابر حملات خصمانه که سازوکارهای ایمنی را دور می&amp;zwnj;زنند. این مرور سیستماتیک با پیروی از چارچوب گزارش&amp;zwnj;دهی پریزما ۲۰۲۰ و بررسی ۳۱ مطالعه منتخب از سال&amp;zwnj;های ۲۰۲۳ تا ۲۰۲۵، به بررسی ریشه&amp;zwnj;های فنی توهم در سطوح مختلف (شیء، ویژگی، رابطه و روایت)، سازوکارهای جیل&amp;zwnj;بریک بصری، و راهبردهای کاهش در زمان آموزش و استنتاج می&amp;zwnj;پردازد. یافته&amp;zwnj;های این مطالعه نشان می&amp;zwnj;دهد که اتکای بیش از حد به پیشین&amp;zwnj;های زبانی، ریشه مشترک بسیاری از خطاهای توهمی و شکست&amp;zwnj;های ایمنی است و هم&amp;zwnj;ترازی صرفاً متنی برای سیستم&amp;zwnj;های چندوجهی کافی نیست. همچنین، شکاف معناداری میان توانمندی&amp;zwnj;های ارزیابی فعلی و پیچیدگی واقعی آسیب&amp;zwnj;پذیری&amp;zwnj;ها وجود دارد که مانع سنجش جامع قابلیت اعتماد می&amp;zwnj;شود. این مرور با ارائه تاکسونومی یکپارچه از آسیب&amp;zwnj;پذیری&amp;zwnj;ها و نقشه راه پژوهشی، چارچوبی برای توسعه مدل&amp;zwnj;های قابل اعتمادتر فراهم می&amp;zwnj;آورد.&lt;/p&gt;</OtherAbstract>
    <ObjectList>
      <Object Type="Keyword">
        <Param Name="Value">مدل‌های بینایی-زبان، قابلیت اعتماد؛ توهم، ایمنی چندوجهی، جیل‌بریک بصری</Param>
      </Object>
    </ObjectList>
    <ArchiveCopySource DocType="Pdf">http://jour.aicti.ir/fa/Article/Download/53399</ArchiveCopySource>
  </ARTICLE>
</ArticleSet>