3줄 요약
- 대화형 영상 AI 기업 Tavus가 2026년 10월에 첫 ‘인간 상호작용 모델(Human Interaction Model, HIM)‘인 Griffin을 발표했다. Griffin은 상대의 음성과 영상을 계속 입력받으면서 1초보다 짧은 간격마다 말할지, 맞장구칠지, 기다릴지를 정하고, 목소리와 얼굴, 몸짓, 배경을 함께 생성한다. 지금은 연구 프리뷰 단계인 Griffin-Lite만 일부 테스터에게 제공되며, 더 강력한 정식 모델은 아직 공개되지 않았다.
- NVIDIA의 전이중 화상 대화 벤치마크 VideoFDB에서 Griffin-Lite는 생성 부문 3.83점, 지각 부문 3.73점을 받아 두 부문 모두 공개된 비교 대상 가운데 가장 높았다. 사람의 실제 대화 녹화를 채점한 기준 점수는 3.92점이고, Griffin-Lite의 생성 부문 점수는 이보다 0.09점 낮다.
- 참가자에게 상대가 다른 참가자라고 안내한 1분 화상 통화 실험에서, 54명 중 26명(48%)이 상대를 실제 사람으로 판단했다. 같은 절차에서 이전 시스템을 사람으로 믿은 참가자는 41명 중 1명(2.4%)이었다. Tavus는 이 결과를 실시간 영상 튜링 테스트를 처음 통과한 사례라고 밝혔고, 사람을 속일 수 있다는 위험 때문에 고객 공개를 보류했다.
휴먼 컴퓨팅이라는 목표
발표 첫머리에는 공동 창업자이자 CEO인 하산 라자(Hassaan Raza)의 글이 실려 있다. 그의 문제의식은 이렇다. 사람은 말과 함께 표정, 어조, 몸짓, 타이밍으로 소통하는데, 기계와 대화할 때는 사람이 기계의 방식에 맞춰야 한다. 그는 기계와의 대화에서 흔히 겪는 순간들을 이렇게 적었다.
개인적이거나 힘든 이야기를 꺼내도 화면 속 얼굴은 계속 웃고 있거나, 얼굴 없는 차가운 기계가 가만히 있다가 단조로운 목소리로 “유감입니다"라고 답한다. 생각을 정리하려고 잠깐 멈추면 기계는 아직 끝나지 않은 말에 끼어들어 대답한다. 답을 준비하느라 시간이 걸리는데도, 표정에도 목소리에도 몸짓에도 지금 준비 중이라는 표시가 없다.
라자는 이런 순간마다 사람이 기계를 관리하게 된다고 썼다. 사람은 말하기 전에 생각을 완결된 문장으로 정리하고, 침묵이 길어지지 않게 신경 쓰고, 기대치를 낮춘다. Tavus가 말하는 ‘휴먼 컴퓨팅’은 기계가 사람처럼 보고 듣고 반응하게 만들어 이런 수고를 없애는 일이다.
Griffin이 대화에서 하는 일
Griffin-Lite는 입력도 출력도 영상이고, 듣는 동안에도 말할 수 있는 전이중(full-duplex) 방식으로 동작한다. 상대를 보고 듣는 일, 언제 어떻게 반응할지 정하는 일, 표현이 풍부한 음성과 영상을 생성하는 일이 동시에 진행된다. 턴제 시스템은 사용자가 말을 마칠 때까지 기다린 뒤에 생각하고 말한다. Griffin은 1초보다 짧은 ‘미니 턴’마다 말을 시작할지, 반응할지, 기다릴지를 정하고, 그동안에도 계속 듣고 본다.
Tavus의 이전 대화형 영상 인터페이스는 얼굴 생성 모델 Phoenix-4.5, 발화 시점 판단 모델 Sparrow-2, 시각 이해 모델 Raven-1을 조합한 시스템이었다. Griffin은 이 기능들을 하나의 시스템으로 통합했다.
Tavus는 Griffin을 처음 써 보는 사람들과 자사 연구원들을 모아 자유 대화와 짧은 시연을 진행했고, 그 클립으로 다섯 가지 능력을 소개했다.
| 능력 | 원문의 설명 | 시연 클립 |
|---|---|---|
| 행동과 감정 표현 | 대화 맥락에 맞춰 행동, 감정, 몸짓을 표현한다. 웃고, 어조를 바꾸고, 상대의 말과 행동에 따라 반응을 바꾼다 | Rudy가 승진 소식을 전하자 Vanessa가 말이 끝나기 전에 반응한다. 두 사람이 잠깐 동시에 말해도 대화는 계속 이어진다 |
| 장면 전체 생성 | 참조 이미지 한 장으로 모든 프레임의 모든 픽셀을 실시간 생성한다. 얼굴과 팔, 손가락과 함께 의자의 움직임, 그림자, 배경도 생성한다 | Mars와 ‘시몬 가라사대’ 놀이를 한다. 상대가 “Simon says"라고 말할 때만 몸짓을 따라 하고, 그 말 없이 지시하면 속임수를 알아챈다 |
| 전이중 대화 | 턴과 관계없이 대화 상태를 계속 평가한다. 끼어들고, 말을 고치고, 맞장구치고, 상대가 끼어들어도 하던 이야기를 이어 간다 | Ari와 Griffin이 서로 말을 끊어 가며 이야기를 지어낸다. Ari가 전개를 바꿀 때마다 Griffin은 그 전개를 살려 이야기를 계속한다 |
| 지각 | 말의 의미와 함께 눈에 보이는 정보도 대화에 반영한다 | Ari의 루빅스 큐브 풀이를 코치한다. 큐브를 보면서 계속 호응하고, Ari가 손을 멈추면 준비될 때까지 기다린다. 다른 클립에서는 이야기 도중에 누군가 장난감 공작새를 들어 보이자, 요청받지 않았는데도 다음 대사에서 공작새를 이야기에 등장시킨다 |
| 시간 이해 | 침묵이 얼마나 길었는지, 긴 침묵이 무엇을 뜻하는지, 언제 스스로 다시 말할지를 판단한다 | Sagar가 메인보드를 납땜하는 동안 경과 시간과 작업 단계를 추적한다. Sagar가 조용해질 때마다 말을 걸지 않고, 다음 단계를 진행할 때가 되면 말한다 |


시스템 구성
Griffin은 두 엔진으로 구성된다.
- 연속 대화 모델링(Continuous Conversational Modeling) 엔진은 입력되는 음성과 영상을 지각하고, 언제 어떻게 반응할지 정하고, 무엇을 어떻게 말할지 결정하는 신호를 만든다.
- 시청각 생성(Audio Visual Generation) 엔진에서는 스트리밍 음성 생성기와 스트리밍 영상 생성기가 대화 모델의 신호를 받아 각각 음성과 영상을 만든다.
지각과 결정과 생성이 대화 내내 동시에 실행되므로, 모델은 말하는 도중에도, 듣는 도중에도 대화의 변화에 반응할 수 있다. Tavus의 설명에 따르면 대화 모델은 음성과 영상을 직접 제어한다. 이 구조에서는 말하는 도중에 내린 결정(멈추기, 시선 돌리기, 미소 짓기, 끼어들기)이 별도 시스템 사이의 전달 과정 없이 같은 미니 턴에 목소리와 얼굴에 반영된다.

연속 대화 모델링
Griffin은 턴마다 한 번 판단하지 않고, 1초 미만의 일정한 간격마다 대화에 관한 결정을 내린다. 간격마다 지금까지 양쪽이 한 말과 사용자의 언어적, 비언어적 행동을 바탕으로 대화 상태를 평가하고, 다음에 무슨 말을 어떻게 할지 정한다. 이와 달리 음성 인식, 언어 모델, 음성 합성을 차례로 잇는 캐스케이드 시스템은 사용자가 말을 마칠 때까지 기다렸다가 응답을 시작한다.
대화 모델은 출력으로 말의 내용과 함께 전달 방식과 비언어 행동, 다시 말해 감정을 드러내는 어조, 태도, 표정, 몸짓까지 제어한다. 이 결정을 맥락에 따라 계속 내리므로, 모델은 언제 말을 시작하고 언제 멈출지를 음성이 끊긴 시점 대신 말의 내용으로 판단한다. 따라서 사용자가 생각하느라 잠시 멈춰도 모델은 그것을 턴의 끝으로 처리하지 않는다. 같은 방식으로 모델은 사용자가 말하는 동안 고개를 끄덕이고, 적절한 순간에 맞장구를 치거나 내용을 확인하고, 사용자의 말과 비언어 행동에 맞춰 응답의 감정을 조절한다.
대부분의 대화형 시스템은 음성만 입력받지만, Griffin은 영상도 함께 받는다. 시각 입력으로 시선과 표정 같은 비언어 신호를 읽고, 사용자의 주변 환경이나 사용자가 공유한 화면 같은 시각 자료도 활용한다.

그림에서 Griffin 쪽 눈금 하나가 미니 턴 하나다. 모델은 눈금마다 듣고 본 것을 바탕으로 가만히 있을지, 고개를 끄덕이거나 표정으로 신호를 보낼지, 맞장구칠지, 말을 시작할지를 정한다.1
스트리밍 음성 생성과 Tavec 코덱
Griffin-Lite의 음성 생성기는 대화에 지장이 없을 만큼 짧은 지연 시간으로 고품질 음성을 만들고, 약 10초 분량의 음성으로 화자의 목소리를 복제한다. 음성 생성 모델로는 빠른 자기회귀 확산 트랜스포머인 VDiT를 쓴다. 참조 음성 클립을 인코딩해 접두부(prefix)로 넣고, 대화 모델의 출력과 제어 신호가 도착할 때마다 새 음성의 잠재 표현을 일정 분량씩 생성한다. 발화 전체가 완성되기를 기다리지 않으므로 생성과 재생이 동시에 진행되고, 문장이 완성되기 전에 소리를 내기 시작한다. 발화 도중에 어조 변화나 머뭇거림 같은 제어 신호가 도착하면 다음 응답을 기다리지 않고 곧바로 이어지는 프레임부터 반영된다.
음성은 Tavus가 만든 합성곱 오토인코더 Tavec으로 표현한다.
| 항목 | 값 |
|---|---|
| 입출력 표본화율 | 48kHz |
| 잠재 표현 | 프레임당 연속값 40개, 초당 100프레임, 코드북 없음 |
| 디코더 | 완전 인과적(미래 프레임을 참조하지 않음), 청크 사이의 상태를 유지 |
| 최소 오디오 패킷 | 10ms |
| 음성 1분의 크기 | 잠재 프레임 6,000개 (원시 오디오로는 표본 288만 개) |
Tavec은 이산 토큰 대신 연속 표현을 쓴다. Tavus는 이 선택으로 양자화기의 기울기를 근사하지 않고도 회귀 기반 플로 매칭(flow matching)을 쓸 수 있고, 오디오 파이프라인 전체를 미분 가능하게 만들 수 있다고 설명했다. 잠재 표현이 작고 연속적이어서 VDiT가 실시간보다 빠르게 프레임을 생성하고, 인과적 디코더는 생성된 프레임을 곧바로 소리로 출력한다.
스트리밍 영상 생성과 3단계 증류
이전 Tavus 모델들은 3D 사전 정보(3D prior)에 크게 의존했다. 이 때문에 손동작과 큰 몸짓 같은 복잡한 행동, 움직이는 배경을 표현하지 못했다. Tavus는 Griffin의 영상 생성기를 확산 모델 기반으로 새로 만들면서 다음 세 가지를 요구 사항으로 정했다.
- 입력되는 음성과 표현 제어 신호의 청크마다 빠르게 반응한다.
- 빠르게 바뀌는 제어 신호를 처리한다.
- 오래 생성해도 화질, 입 모양 동기화, 인물의 동일성을 유지한다.
원문은 자기회귀 잠재 영상 모델이 보통 이 가운데 하나 이상을 포기한다고 진단했다. 완성된 생성기는 720p 영상을 320밀리초 청크 단위로 실시간 생성한다. 생성기는 참조 이미지 한 장과 스트리밍 음성, 그리고 몸짓과 시선, 감정을 조절하는 스트리밍 제어 신호를 입력받는다. VAE가 시간 축을 8배 압축하므로 초당 25프레임 기준으로 잠재 표현 하나가 8프레임, 즉 320밀리초 분량이다. 생성기는 잠재 표현 하나를 만들 때마다 확산 단계를 세 번 거치고, 오래된 이력일수록 낮은 해상도로 보관한다. 이 덕분에 영상이 길어져도 계산 비용이 적게 든다.

이 생성기의 출발점은 크고 양방향이며 여러 단계를 거치는 확산 모델이다. 그 모델을 소수 단계 자기회귀 생성기로 증류하는 작업은 세 단계로 진행됐다.
| 단계 | 방법 | 결과 |
|---|---|---|
| 출발점 | 교사 모델 | 양방향, 수십 단계의 확산 모델. 클립 전체를 한 번에 보며, 품질은 높지만 너무 느리다 |
| 1단계 | 분포 정합 증류(Distribution Matching Distillation) | 소수 단계로 생성하는 학생 모델. 빠르지만 긴 영상을 하나의 긴 청크로 생성하므로 스트리밍할 수 없다 |
| 2단계 | 교사 강제(teacher forcing) | 앞서 생성한 프레임을 조건으로 잠재 표현을 하나씩 생성하는 자기회귀 모델로 전환한다 |
| 3단계 | 자기 강제(Self-Forcing) | 모델이 스스로 생성한 이력으로 학습해, 오래 생성해도 품질이 점점 나빠지는 드리프트가 생기지 않는다. 이력 프레임에 적용하는 별도 장치를 더해 안정성을 높였다 |
이렇게 만든 생성기 덕분에 대화 모델은 음성에 맞춘 행동만 만드는 데 그치지 않고 비언어 행동까지 세밀하게 제어할 수 있게 됐다고 한다.
평가 1: 영상 생성기 단독 비교
Tavus는 공개에 앞서 Griffin-Lite를 세 가지 방식으로 평가했다. 영상 생성기만 따로 비교했고, NVIDIA의 VideoFDB 벤치마크로 시스템 전체를 평가했으며, 상대가 모델인 줄 모르는 사람들과 1분 동안 화상 통화를 하는 실험도 했다.
첫 번째 평가에서는 영상 생성기를 공개된 스트리밍 확산 모델 4종과 비교했다. 비교는 각 모델에 음성과 참조 이미지를 주고 말하는 얼굴 영상을 생성하게 하는 방식으로 진행했다.
- 지연 시간: 음성이 들어온 뒤 그 음성의 효과가 화면에 나타나기까지의 시간을 쟀다. Griffin-Lite는 잠재 표현을 하나씩 생성하고 이후에 입력될 음성(lookahead)을 기다리지 않는다. H100에서 평균 0.43초로, 다음으로 빠른 방법의 절반이었다. 사용자가 끼어들거나 모델이 고개를 끄덕여야 하는 순간에, 얼굴이 반응하기까지 걸리는 시간이 그만큼 줄어든다.
- 화질: 영상 품질 표준 지표인 DOVER와 FID, 말하는 얼굴 영상을 위해 최근 발표된 평가 체계 THEval, 세 지표 모두에서 다섯 모델 중 1위였다.2
- 입 모양 동기화: LSE-C 점수는 7.27로 다섯 모델 중 2위였다.3
평가 2: NVIDIA VideoFDB
NVIDIA는 전이중 화상 대화를 평가하려고 VideoFDB를 만들었다. 이 벤치마크는 대화와 시선, 표정, 몸 움직임 같은 상호작용 신호에 모델이 어떻게 반응하는지, 또 모델이 그런 신호를 어떻게 만들어 내는지를 평가한다. 대화 품질과 응답 시간도 함께 측정한다. 생성 부문과 지각 부문에 각각 다른 채점 기준과 순위표가 있고, NVIDIA가 공개된 지표와 자체 판정 모델로 독립적으로 평가한다. NVIDIA는 2026년 9월에 Griffin-Lite를 채점했다. 판정은 언어 모델이 맡았고, 응답마다 0점에서 5점 사이의 점수를 매겼다. 한 모델이 생성 부문과 지각 부문에서 모두 평가받은 것은 Griffin-Lite가 처음이라고 한다.
생성 부문은 사람의 음성을 입력으로 주고, 모델이 만든 음성과 영상을 함께 채점한다. 발화가 유창한지, 감정이 상황과 일치하는지, 비언어 행동이 그 순간에 맞는지를 본다. 원문은 상대가 웃고 난 다음에 따라 웃는 대신 상대와 함께 웃는지를 예로 들었다.

Griffin-Lite의 3.83점은 다음으로 높은 Gemini 2.5 + Anam보다 1.03점 높고, 사람 기준보다 0.09점 낮다. Tavus는 사람 점수와의 격차가 평가된 다른 어떤 시스템의 격차와 비교해도 12분의 1 이하라고 썼다.
지각 부문은 사람의 음성과 영상을 입력으로 주고, 모델의 음성 응답을 유창성, 대화 흐름, 시각적 근거로 채점한다. 시각적 근거 항목은 상대가 말을 멈추고 시선을 돌리는 것처럼 눈에 보이는 정보를 응답에 활용하는지를 본다.

Griffin-Lite는 3.73점으로 평가된 15개 모델 가운데 가장 높았다. 2위인 MiniCPM-o 4.5보다 0.29점 높고, 사람 기준보다 0.47점 낮다.4
VideoFDB는 발언 전환 시점 일치도(takeover-rate alignment)까지 함께 보고한다. 언제 말을 시작할지 모델이 내린 결정이 기준 대화의 타이밍과 얼마나 맞는지를 재는 지표다. Griffin-Lite는 생성 부문 62.8%, 지각 부문 73.8%로 두 부문 모두 가장 높았다.
평가 3: 1분 화상 통화 실험
Tavus는 새 모델을 만들 때마다 독립 연구 플랫폼에서 참가자를 모집해, 실제 대화에서 모델이 얼마나 사람처럼 느껴지는지 확인한다고 했다. 참가자는 상대가 무엇인지 모르는 채로 짧은 화상 통화를 하고, 통화가 끝난 뒤 상대가 실제 사람이었다고 생각하는지 답한다. 지금까지는 그렇다고 답한 참가자가 거의 없었다고 한다.
방법: 참가자에게는 다른 참가자와 짝을 지어 1분 동안 “올해 기대하는 일"을 주제로 화상 통화를 한다고 안내했다. 대화 상대는 Griffin-Lite로 동작하는 AI 캐릭터 PAL5이었고, 얼굴과 목소리, 응답을 모두 실시간으로 생성했다. 통화가 끝난 뒤 참가자는 상대가 그 주제에 관해 한 대답을 적었다. 이어서 상대가 얼마나 자연스럽고 믿을 만했는지, 대화가 잘 이어졌는지, 상대가 정말 귀 기울여 듣는다고 느꼈는지를 평가했다. 상대가 실제 사람이 아닐 수 있다는 생각을 했는지, 했다면 언제였는지는 설문의 맨 마지막에 물었다. 그 뒤 모든 참가자에게 상대가 AI였다고 알렸다. Phoenix-4.5, Sparrow-2, Raven-1을 조합한 이전 시스템도 같은 절차로 실험했다.

결과:
- Griffin-Lite와 대화한 54명 중 26명(48%)이 상대를 실제 사람으로 판단했다. 이전 시스템은 41명 중 1명(2.4%)이었다.6
- 참가자들은 어느 답을 골랐든 자기 판단을 꽤 확신했다. 평균 확신도는 사람이라고 답한 참가자들이 79%, AI라고 답한 참가자들이 81%였다.
- 참가자의 절반 이상은 통화하는 동안 상대가 사람이 아닐 수 있다는 생각을 하지 않았고, 이들은 거의 모두 상대가 사람이었다고 답했다. 의심한 참가자들이 처음 의심한 시점은 대개 통화 시작 후 20초 이내였다.
7점 척도로 받은 평가는 다음과 같다.
| 항목 | 평균 점수 |
|---|---|
| 다시 대화하고 싶은가 | 5.8 (상대를 AI라고 답한 참가자만 보면 5.4) |
| 믿을 만한가 | 5.6 |
| 상대가 정말 귀 기울여 듣는다고 느꼈는가 | 5.5 |
| 자연스러운가 | 5.4 |
| 대화가 자연스럽게 이어졌는가 | 4.9 (다섯 항목 중 최저) |
이 결과로 Griffin-Lite는 Tavus가 아는 한 실시간 영상 튜링 테스트를 통과한 첫 모델이 됐다.
안전과 공개 범위
Tavus는 인간 상호작용 모델의 위험을 이렇게 설명했다. 이 모델을 사람과 기계 사이의 자연스러운 소통 수단으로 만드는 성질은 사람을 속여 상대를 사람으로 믿게 하는 데에도 쓰일 수 있다. Tavus는 안전하게 공개하려면 추가 정렬 작업과 안전 절차가 필요하다고 보고, AI임을 밝히는 공개 기능을 개발하면서 AI 안전을 다루는 단체들과 협력하고 있다고 한다.
Griffin-Lite는 현재 고객에게는 제공되지 않고, 선정된 신뢰 테스터만 연구 프리뷰로 이용할 수 있다. 정식 Griffin은 이 안전 문제를 해결한 뒤 곧바로 공개할 예정이라고 한다. 그때까지 Tavus 플랫폼에서는 얼굴을 생성하는 Phoenix, 사용자를 보고 이해하는 Raven, 말할 때를 판단하는 Sparrow 같은 기존 모델로 PAL을 만들 수 있다. 이 모델들을 쓰는 개발자와 기업은 모두 15만이라고 한다.
다음 단계
Tavus는 Griffin을, 사람이 조작하는 대신 함께 일할 수 있는 컴퓨터를 만드는 과정의 초기 성과로 소개하고 쓰임새 세 가지를 들었다.
- 학생은 설명이 이해되지 않는 순간을 알아채고 다른 방식으로 다시 설명해 주는 개인 교사의 도움을 받을 수 있다.
- 직장인은 실제 사람처럼 반응하는 상대와 어려운 대화를 미리 연습할 수 있다.
- 고객은 고장 난 부품의 이름을 몰라도 카메라에 들어 보이면서 수리 방법을 함께 찾을 수 있다.
세 경우 모두 사람이 원하는 것을 정확한 명령어나 메뉴로 바꿀 필요가 없다. 다른 사람에게 하듯 설명하면 모델이 말과 표정과 그 순간의 상황으로 뜻을 파악한다. 라자가 글 첫머리에서 휴먼 컴퓨팅이라는 말로 바란 컴퓨터도 이런 모습이었다.
내가 다시 읽은 대목
실험 결과를 읽으면서 나는 이전 시스템의 2.4%를 몇 번이나 다시 봤다. 참가자들은 상대가 다른 참가자라고 안내받았으니, 처음부터 사람과 대화한다고 믿을 이유가 충분했다. 그런데도 같은 안내를 받은 41명 가운데 40명이 이전 시스템을 AI로 판단했다. 안내를 받았다고 해서 참가자들이 상대를 사람으로 믿은 것은 아니었다. Griffin-Lite의 48%는 그 조건에서 나온 수치이고, 참가자의 절반 이상은 통화하는 동안 한 번도 의심하지 않았다.
안전을 다룬 대목까지 읽고 나니, 성과를 말하는 근거와 위험을 말하는 근거가 같은 실험이라는 생각이 들었다. 54명 중 26명이 상대를 사람으로 믿었다는 결과는 Tavus가 튜링 테스트 통과의 근거로 든 수치이면서, 고객 공개를 미룬 이유인 기만 위험의 근거이기도 하다. Tavus가 개발 중이라는 ‘AI임을 밝히는 기능’이 적용된 뒤에는 참가자가 처음부터 상대가 AI임을 알게 될 테니, 48%라는 수치는 다시 잴 수 없을 것이다. 그때는 다른 수치가 더 중요해질지도 모르겠다. 상대를 AI라고 답한 참가자들도 ‘다시 대화하고 싶은가’라는 질문에는 7점 만점에 5.4점을 줬다.
출처
Tavus Research, 하산 라자(공동 창업자 겸 CEO)와 이오아니스 파트라스(Ioannis Patras, 연구 책임자) 외, “Griffin: The First Human Interaction Model”, Tavus, 2026년 10월. 프리뷰 인프라는 Baseten, Daily, Cerebrium이 지원했고, 런던 퀸메리 대학교가 연구에 협력했다.
원문: https://www.tavus.io/griffin
VideoFDB 순위표: https://research.nvidia.com/labs/amri/projects/video-fdb/
원문의 타임라인 그림은 실제 세션에서 측정하지 않은 설명용 타이밍이라고 Tavus가 밝혔다. ↩︎
FID는 값이 낮을수록 좋은 지표다. ↩︎
Tavus에 따르면 LSE-C는 입을 크게 움직일수록 점수가 높아지는 지표여서, 자연스러운 정도보다 과한 입 움직임에도 점수가 오른다. THEval은 이 점을 감안한 평가 체계라고 한다. ↩︎
Griffin은 음성과 영상을 모두 입력받았고, MiniCPM-o 4.5와 OpenAI gpt-realtime은 음성만 입력하는 설정으로 채점됐다. ↩︎
PAL은 Tavus가 사람과 얼굴을 마주하고 대화하는 AI 캐릭터를 부르는 이름이다. ↩︎
발표 도입부는 이전 시스템의 통과율을 “최대 2%“로 적었고, 실험 부분의 수치는 41명 중 1명, 즉 2.4%다. ↩︎
