Boosting Image Caption Generation with Parts of Speech

Philgoo Kang; Yubin Lim; Hyoungjoo Kim

Boosting Image Caption Generation with Parts of Speech

Philgoo Kang

Yubin Lim

Hyoungjoo Kim

48권 3호, pp. 317-324, 3월 2021

10.5626/JOK.2021.48.3.317

PDF

요약

일상 생활 속에서의 스마트 기기와 AI에 대한 의존도가 높아지면서, 시각 장애인 보조, 인간컴퓨터 상호 작용 등 다양한 분야에 접목 가능한 이미지 캡션 생성 기술의 중요성이 높아지고 있다. 본 논문에서는 캡션 생성 기능의 향상을 위해 명사, 동사와 같은 언어의 품사(POS) 정보를 이미지로부터 추출하여 활용하는 새로운 기법을 제안한다. 제안하는 모델은 복수의 CNN 인코더를 품사 별로 학습하여 품사별 특징 벡터를 추출한 후, 추출한 품사 벡터를 LSTM에 입력하여 캡션을 생성한다. 제안한 모델은 Flickr30k, MS-COCO 데이터 셋에 대해 실험을 진행하며, 사람을 대상으로 2가지 설문 조사를 진행하여 결과물의 실질적인 유효성을 검증한다.

통계

2022년 11월부터 누적 집계
동일한 세션일 때 여러 번 접속해도 한 번만 카운트됩니다. 그래프 위에 마우스를 올리면 자세한 수치를 확인하실 수 있습니다.

논문 참조

[IEEE Style]

P. Kang, Y. Lim, H. Kim, "Boosting Image Caption Generation with Parts of Speech," Journal of KIISE, JOK, vol. 48, no. 3, pp. 317-324, 2021. DOI: 10.5626/JOK.2021.48.3.317.

[ACM Style]

Philgoo Kang, Yubin Lim, and Hyoungjoo Kim. 2021. Boosting Image Caption Generation with Parts of Speech. Journal of KIISE, JOK, 48, 3, (2021), 317-324. DOI: 10.5626/JOK.2021.48.3.317.

[KCI Style]

Philgoo Kang, Yubin Lim, Hyoungjoo Kim, "Boosting Image Caption Generation with Parts of Speech," 한국정보과학회 논문지, 제48권, 제3호, 317~324쪽, 2021. DOI: 10.5626/JOK.2021.48.3.317.

[Endnote/Zotero/Mendeley (RIS)] Download

[BibTeX] Download

Search

Journal of KIISE

ISSN : 2383-630X(Print)
ISSN : 2383-6296(Electronic)
KCI Accredited Journal

사무국

Tel. +82-2-588-9240
Fax. +82-2-521-1352
E-mail. chwoo@kiise.or.kr

정보과학회논문지

정보과학회논문지

Boosting Image Caption Generation with Parts of Speech

Search

사무국