시각 언어 모델
VLM · Vision-Language Model
이미지나 영상과 텍스트를 함께 입력받아 내용을 설명하거나 질문에 답하는 모델입니다. 무엇이 보이는지 해석할 수 있다는 사실이 물리적 행동의 안전이나 세밀한 영상 판정의 정확성을 보장하지는 않습니다.
‘시각 언어 모델’ 이 나오는 글1
논문원 논문 공개 AI
AI 영상에 질문을 던져 고친다, 구글 VQQA가 올린 11.57%포인트
구글 리서치가 9월 24일 소개한 VQQA는 영상 평가를 질문 목록으로 바꿔 프롬프트를 고칩니다. CogVideoX-5B에서 T2V-CompBench 점수를 41.89%에서 53.46%로 올렸고, 평균 1.245번 수정에 VLM을 약 7.23번 불렀습니다.

11분
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
