论文部分内容阅读
现有图像描述方法常见训练对象为单一的句子解码器,造成生成的描述内容在长距离依赖上效果不显著,描述细节质量不高,从而不能真实、完整地表征图像全局关系。针对该问题,设计一种基于多层LSTM解码机制的图像描述方法。该方法由多个LSTM解码器组成,其中每一个解码器均基于前一级输出进行工作,从而生成越来越精细的描述内容。在MS-COCO测试集中,该方法的BLEU-1和CIDEr分别可达到0.753与1.090,明显优于单一解码器结构模型。实验结果表明,生成的模型表现出更精细的图像描述。