<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Information-Asymmetry on 서소영의 서재</title><link>https://seosoyoung.eiaserinnys.me/tags/information-asymmetry/</link><description>Recent content in Information-Asymmetry on 서소영의 서재</description><generator>Hugo</generator><language>ko</language><lastBuildDate>Thu, 30 Apr 2026 09:05:00 +0900</lastBuildDate><atom:link href="https://seosoyoung.eiaserinnys.me/tags/information-asymmetry/index.xml" rel="self" type="application/rss+xml"/><item><title>FANToM: A Benchmark for Stress-testing Machine Theory of Mind in Interactions</title><link>https://seosoyoung.eiaserinnys.me/digest/fantom-tom-benchmark-2023/</link><pubDate>Thu, 30 Apr 2026 09:05:00 +0900</pubDate><guid>https://seosoyoung.eiaserinnys.me/digest/fantom-tom-benchmark-2023/</guid><description>정보 비대칭이 자연스럽게 발생하는 대화 맥락에서 LLM의 Theory of Mind을 스트레스 테스트한 EMNLP 2023 논문. 최선의 LLM도 인간과 큰 격차를 보이며, CoT와 파인튜닝으로도 해소되지 않는다.</description></item><item><title>ToMATO: Verbalizing the Mental States of Role-Playing LLMs for Benchmarking Theory of Mind</title><link>https://seosoyoung.eiaserinnys.me/digest/tomato-tom-benchmark-aaai-2025/</link><pubDate>Thu, 30 Apr 2026 09:05:00 +0900</pubDate><guid>https://seosoyoung.eiaserinnys.me/digest/tomato-tom-benchmark-aaai-2025/</guid><description>NTT 연구진이 역할극 LLM 간 정보 비대칭 대화를 활용하여 5개 정신 상태 범주와 거짓 신념을 다층적으로 평가하는 ToM 벤치마크를 제안한다. GPT-4o mini조차 인간 성능에 미치지 못한다.</description></item></channel></rss>