想要客观评估检测工具,需要简单了解图片查重软件原理。科研图片查重和文字查重原理完全不一样,文字查重比对字符,图片查重比对图像视觉特征。
第一步:图像预处理。不管直接上传图片,还是上传 PDF/Word 文档,软件首先解析文档,提取全部插图;做统一预处理,降噪、归一化尺寸,消除分辨率、文件格式带来的干扰。
第二步:提取图像多维特征向量。科研图片查重软件依靠深度学习 AI 模型提取图片关键视觉特征,并非简单比对图片文件哈希值。两张图片即便文件大小、分辨率、格式不一样,只要图像核心实验内容同源,提取的特征向量就会高度接近。
这也是图片缩放、旋转、镜像、轻微调色仍然有机会被识别的原因;普通简易哈希比对,只要图片调色,哈希值就发生改变,识别不出重复。你可以在高校论文查重网的 ImageTwin 图片查重:https://www.gxcnki.com/imagetwin/体验这套图像特征比对算法。
第三步:特征库比对运算。分为两种模式: ①内部比对模式:只对比本次上传全部图片之间特征; ②跨库比对模式:把提取图像特征,和后台海量学术图像特征数据库比对,找出和已发表论文相似图像。
第四步:输出相似度与风险标记。计算特征向量之间相似度,输出相似度分值;针对 WB 电泳图设置专项模型,额外识别条带克隆拼接、AI 绘图异常特征,标记疑似风险片段,生成完整检测报告。
局限性:原理决定,图片重度重绘改造,图像特征大幅改变,会存在漏检;目标文献不在数据库,跨库比对无法检出。AI 模型存在少量误判,高相似度不等于学术不端,需要人工复核。
Q:图片查重软件原理是比对像素吗? A:专业科研图片查重不是简单像素比对,是 AI 提取高层视觉特征,可以抵抗缩放、调色干扰。