检测流程

StarNexus Integrity 通过以下步骤完成论文检测:

1

论文解析

AI 自动识别论文结构(标题、摘要、正文、参考文献等),提取文本内容用于分析

2

文本预处理

对文本进行分词、去停用词、归一化等处理,为后续比对和分析做准备

3

相似度比对

与数十亿篇已发表文献进行语义相似度比对,识别可能的抄袭内容

4

AI 内容检测

使用专门训练的模型识别 AI 生成的文本特征,区分人机协同写作内容

5

引用核验

验证参考文献的真实性、准确性和格式规范性,与多个数据库交叉验证

6

报告生成

综合各项检测结果,生成详细的检测报告,包含问题标注和修改建议

技术架构

检测流水线架构

📄
论文上传
🔍
文本解析
🧠
AI 分析
📊
比对核验
📋
报告输出
🤖

核心 AI 模型

  • Transformer-based 文本分析
  • 语义理解与比对
  • AI 生成内容识别
  • 多语言支持
🗄️

数据处理

  • 分布式向量检索
  • 实时索引更新
  • 大规模数据比对
  • 隐私保护处理
🔗

外部数据接入

  • Crossref API
  • Semantic Scholar API
  • OpenAlex API
  • 自定义数据库

算法原理

相似度检测算法

我们采用多种算法组合实现精准的相似度检测:

  • BM25:基于词频的传统信息检索算法,快速定位相似文献
  • SBERT:基于句子嵌入的语义相似度计算,捕捉深层语义相似性
  • SimHash:近似文本检测算法,高效识别改写/重写内容
  • Cross-Encoder:精细的两两比对模型,用于高风险内容的深度分析

AI 内容检测

针对 AI 生成内容,我们采用专门的检测策略:

  • 分析文本的困惑度(Perplexity)特征
  • 检测词汇分布的统计特征
  • 识别常见的 AI 写作模式
  • 综合多种特征进行分类判定

引用核验

引用核验基于多源数据交叉验证:

  • 从文本中自动提取引用信息
  • 调用多个文献数据库 API 进行验证
  • 比对元数据(标题、作者、期刊、年份等)
  • 生成可信度评级

准确率说明

我们的检测系统持续优化,各项检测指标如下:

  • 查重准确率:99%(针对已发表文献)
  • AI 检测准确率:95%(针对主流 AI 模型生成内容)
  • 引用核验准确率:98%(针对 Crossref 收录文献)
  • 误报率:低于 3%(持续优化中)

* 检测结果仅供参考,最终判断应由作者或编辑结合专业知识做出。