ViT 기반미래도로이미지예측: VLM을 활용한 평가

ViT-Based Future Road Image Prediction: Evaluation via VLM
Citations

SCOPUS

0

초록

본 논문은 미래 주행 상황을 효과적으로 예측하기위해 Vision Transformer (ViT) 기반 미래 도로 이미지 예측 모델을 제안한다. 제안하는 ViT 모델 구조는입력 이미지를 패치 단위로 처리하고, 어텐션 메커니즘을 통해 전역적인 시각 정보를 효율적으로 학습할뿐만 아니라, 제어 입력과의 통합적 처리로 시각-제어간 상관관계를 효과적으로 반영할 수 있는 장점을 가진다. 생성된 이미지의 화질 및 설명 유사도 측면에서 성능을 비교한 결과, 제안하는 모델은 기준 모델보다 선명한 이미지를 생성하였으며, Vision-Language Model (VLM)을 활용한 설명 평가에서도 높은 의미유사도를 나타냈다. 이는 ViT 구조가 미래 예측에 효과적일 뿐 아니라, 설명 정보를 활용한 자율주행 제어 연계에도 유용함을 시사한다.

키워드

Autonomous DrivingVision-Language ModelSemanticEvaluationVision Transformer
제목
ViT 기반미래도로이미지예측: VLM을 활용한 평가
제목 (타언어)
ViT-Based Future Road Image Prediction: Evaluation via VLM
저자
김동현권재락남해운
DOI
10.7840/kics.2025.50.10.1532
발행일
2025-10
유형
Y
저널명
한국통신학회논문지
50
10
페이지
1532 ~ 1535