前言:随着生成式人工智能技术的发展,AI 生成图像已经越来越真实,也越来越容易被大规模传播。在多媒体取证与可信 AI 研究中,过去我们更多关注的是:这张图像是真实图像,还是 AI 生成图像?这对应 synthetic image detection。但随着生成模型数量不断增加、模型架构不断演化,仅仅判断“真或假”已经不够。很多实际场景还需要进一步追问:这张 AI 生成图像来自哪里?例如,它来自哪一个生成模型、哪一种生成架构,或者是否来自某个声明的生成源。这类问题对应 synthetic image attribution / source attribution,也就是生成图像来源溯源。近年,我主要围绕 synthetic image detection 与 attribution 方向开展研究,并先后完成了生成图像检测与溯源两篇文献综述。在整理综述和持续跟踪后续文献的过程中,我逐渐发现:这个方向的论文数量增长很快,静态文献列表已经不太适合长期维护。因此,我使用 Codex 辅助搭建了一个交互式网页:Synthetic Image Research Map。
网页链接:https://meiling-fdu.github.io/synthetic-image-research-map/web/?dataset=preview
Synthetic Image Research Map 是一个面向 synthetic image detection 与 attribution 领域的交互式研究地图,旨在帮助研究者更直观地浏览文献、理解机构分布与合作关系,并持续跟踪该方向的发展。该网页目前仍处于持续优化阶段,如果你对相关研究感兴趣,欢迎访问项目页面并在 GitHub 上 Star ⭐️ 支持,有问题也欢迎提交 GitHub Issues!
目录
- 一、网页建设背景
- 二、网页目前支持的功能
- 1. 文献记录浏览
- 2. 世界地图可视化
- 3. 论文详情交互查看
- 4. 多条件筛选与排序
- 5. 动态统计概览
- 6. 「机构+论文」层级结果视图
- Institution records
- Unique papers
- 7. 当前筛选结果 CSV 导出
- 8. 项目范围与质量控制说明
- 9. 数据入口与反馈入口
- 三、相较普通文献列表的优势
- 四、后续计划
- 1. 持续补全文献数据
- 2. 优化机构信息与地理位置
一、网页建设背景
在写综述时,我需要持续整理 AI-generated image detection、GAN-generated image attribution、diffusion-generated image detection、source generator attribution、model attribution、verification 等方向的论文。
如果只用表格、文档或博客记录文献,虽然可以保存 title、year、venue、method、dataset 等信息,但很难直观回答以下问题:
- 这个领域的研究主要集中在哪些国家和地区?
- 哪些高校、研究机构或公司在持续关注这个方向?
- 不同机构之间是否存在合作关系?
- 某篇论文背后有哪些作者和机构参与?
- 当新论文不断出现时,如何持续维护,而不是反复修改静态博客?
因此,我希望将论文、作者、机构和地理位置结合起来,构建一个可以交互查看的研究地图。它的目标不是再做一个普通论文列表,而是从空间分布和机构合作的角度观察 synthetic image detection / attribution 领域的发展情况。
换句话说,我希望这个网页回答的不只是“有哪些论文”,还包括:
- 这些论文来自哪些地区和机构;
- 哪些机构在该方向比较活跃;
- 哪些机构之间存在合作;
- 不同任务方向在全球范围内如何分布;
- 后续新增文献如何更加系统地维护和更新。
二、网页目前支持的功能
当前网页主要围绕 AI 生成图像检测与溯源相关论文进行整理和可视化。相比普通文献列表,它更强调结构化检索、地图展示、机构信息、质量控制和数据导出。
1. 文献记录浏览
网页收录了 synthetic image detection 与 attribution 相关论文,覆盖 detection、source attribution、detection and source attribution 等任务类型。
每条记录会尽量整理以下信息:
- 论文标题;
- 作者列表;
- 发表年份;
- 发表地址;
- DOI;
- arXiv link;
- paper link;
- 任务类型;
- 论文类型,例如 method、dataset、benchmark、survey、analysis study;
- 作者对应机构;
- institution、country、region、coordinates 等地理信息;
- version status,例如是否为 preprint-only,是否存在 arXiv version;
- resolution confidence 与 review status。
2. 世界地图可视化
网页使用世界地图展示相关论文机构的地理分布。每个地图 marker 对应一条 institution-level record,即某篇论文在某个机构上的映射记录。
通过地图可以直观看到:
- 哪些国家或地区在该方向更活跃;
- 哪些机构参与了相关研究;
- 同一篇论文涉及哪些机构;
- 某些研究方向是否呈现区域集中趋势。
地图 marker 会按任务类型区分颜色,目前主要包括:
- Detection;
- Source attribution;
- Detection and source attribution。
这使得用户不仅能看到“有哪些论文”,还能看到“这些论文分布在哪里”。
3. 论文详情交互查看
在地图上 hover 或选择某个 marker 后,右侧会显示对应论文的详细信息。
这一功能可以把地图上的机构位置和具体论文关联起来。用户可以进一步查看论文标题、作者、机构、任务类型、发表信息和相关链接,从而快速理解某个地图点背后的研究内容。
如果同一篇论文涉及多个机构,网页也可以展示该论文相关的多个机构位置,帮助观察 paper-level 合作关系。
4. 多条件筛选与排序
网页提供了较完整的筛选功能,可以从不同角度检索当前数据集。
目前支持的筛选项包括:
- Keyword:按标题、作者、机构等关键词搜索;
- Task:按 detection、source attribution、detection and source attribution 筛选;
- Paper Type:按 method、dataset、benchmark、survey、analysis study 筛选;
- Publication Type:按发表类型(Conference、Journal、Preprint)筛选;
- Publication Venue:按发表地址筛选;
- Country:按国家筛选;
- Institution Type:按发表机构(University、Research Institute、Company等)筛选;
- Record Version:按论文否有对应的arXiv preprint筛选;
- Publication year:按起止年份筛选;
- Reset filters:一键恢复默认筛选状态。
这些筛选项可以组合使用。例如,可以只查看 source attribution 方向的论文,也可以筛选某一年之后、有 arXiv 版本、并来自特定 venue 的记录。
5. 动态统计概览
网页会根据当前筛选条件动态更新统计信息,包括:
- Map records;
- Paper coverage;
- Papers without map location;
- Unique institutions;
- Countries;
- Detection records;
- Source attribution records;
- Detection + source attribution records;
- Preprint-only records。
这些统计信息可以帮助用户快速了解当前筛选范围内的数据规模、任务分布、机构覆盖和地图覆盖情况。
其中,Papers without map location是一个比较重要的提示:它表示某些论文虽然已经进入 paper-level coverage,但由于缺少有效机构坐标,暂时不会显示为地图 marker。
6. 「机构+论文」层级结果视图
网页支持两种结果视图:
Institution records
这是默认视图。由于网页是 institution-record based,同一篇论文如果涉及多个机构,就会对应多条 institution records。这个视图更适合观察机构分布、地图 marker 和 paper-level 合作关系。
Unique papers
这个视图会对同一篇论文进行去重,更接近传统 bibliography-style browsing。它适合用户按论文维度查阅文献,避免同一篇论文因为多个机构而重复出现。
简单来说:
- Institution records更适合看地图和机构分布;
- Unique papers更适合看论文列表和文献覆盖。
7. 当前筛选结果 CSV 导出
网页支持通过Export CSV导出当前筛选结果。导出的内容会根据当前筛选条件和结果视图变化。该功能支持按年份新旧、venue/source、title 字母顺序排序。
如果当前处于Institution records视图,导出的 CSV 更偏向机构记录,通常包含:
- title;
- authors;
- institution_authors;
- publication_year;
- venue_name;
- entry_type;
- task / subtask;
- institution_name;
- country / country_code;
- region / region_code;
- raw_country / raw_country_code;
- DOI;
- arXiv ID / arXiv URL;
- paper URL;
- OpenAlex URL。
如果当前处于Unique papers视图,导出的 CSV 更偏向论文记录,通常包含:
- title;
- authors;
- publication_year;
- venue_name;
- entry_type;
- task / subtask;
- institutions;
- countries / country codes;
- regions / region codes;
- has_map_location;
- map_record_count;
- coverage_status;
- DOI;
- arXiv ID / arXiv URL;
- paper URL;
- OpenAlex URL。
这个功能比较实用。用户可以先在网页中完成筛选,例如只保留特定方向、某个年份范围内的论文,或者某个类型的论文,然后直接导出 CSV,用于后续阅读、分析或本地整理。
8. 项目范围与质量控制说明
网页底部提供了 project scope、data and records、explore and export、quality control 等说明,用于解释这个地图收录什么、不收录什么,以及数据如何被筛选。
目前网页主要覆盖:
- AI-generated image detection;
- synthetic image detection;
- GAN-generated image detection / attribution;
- diffusion-generated image detection;
- fake / deepfake image detection;
- generated image source attribution;
- identification;
- verification。
同时,网页会排除与当前研究主题关系较弱的内容,例如:
- broad model attribution;
- generic feature attribution;
- authorship attribution;
- camera-model attribution;
- sensor attribution;
- 仅使用 synthetic data 做下游任务的数据增强类工作。
此外,public preview 默认会过滤 uncertain、out-of-scope、low-confidence、review-flagged、缺少机构信息或缺少有效坐标的记录。这可以减少明显错误或不确定记录对地图展示结果的影响。
9. 数据入口与反馈入口
网页底部提供了多个数据与项目入口,包括:
- Public preview JSON;
- Public preview papers JSON;
- Sample dataset JSON;
- Quality report;
- Data methodology;
- GitHub repository;
- GitHub Issues。
其中,Public preview JSON 对应地图展示所需的 institution-level records;Public preview papers JSON 更偏向 paper-level coverage。Quality report 和 Data methodology 用于说明数据质量、筛选规则和处理流程。
如果发现 metadata 错误、机构错误或缺失论文,也可以通过 GitHub Issues 反馈。
三、相较普通文献列表的优势
过去我也会通过博客或表格整理文献,但这种方式有几个明显限制。
首先,静态博客更新成本高。每出现一批新论文,都需要手动修改原文,时间久了会越来越难维护。
其次,普通文献列表主要回答“有哪些论文”,但很难展示“论文来自哪里”“哪些机构在合作”“哪些地区更关注这个方向”。
第三,文献状态会变化。例如,一篇论文可能最初只有 arXiv 版本,之后正式发表;有些机构信息可能被数据库错误解析;有些论文是否属于 synthetic image detection / attribution 的核心范围,也需要重新审核。静态博客很难持续反映这些变化。
相比之下,网页和后台数据库更适合承载持续更新的文献信息。它不仅保存论文列表,还能组织作者、机构、位置、任务类型、链接、数据来源、审核状态和导出结果。
因此,后续我会逐步将文献维护工作集中到这个网页和后台数据库中,而不是继续频繁更新单独的文献列表博客。之前我单独整理过的 synthetic image detection / attribution 方向文献列表,也不会再作为主要维护入口持续更新。
主要原因有三点:
第一,当前领域发展很快,新论文不断出现,静态博客不适合长期维护。
第二,网页能够承载更丰富的信息,包括论文、作者、机构、地理位置、合作关系、论文链接、任务分类、数据质量说明和 CSV 导出。
第三,后续我希望形成更加规范的更新流程:新增论文先进入候选池和 review workflow,经过 scope filtering、metadata enrichment、institution normalization 和人工确认后,再加入正式展示数据。
也就是说,后续如果想查看这个方向的最新整理结果,建议直接访问该网页,而不是依赖旧的静态文献列表博客。
四、后续计划
1. 持续补全文献数据
后续会继续补充 synthetic image detection、synthetic image source attribution 以及 source verification 等方向的相关论文。新增论文不会直接自动发布到地图中,而是会先进入候选和审核流程。只有在确认研究范围、元数据、机构信息和地理位置之后,才会加入正式展示数据。
2. 优化机构信息与地理位置
OpenAlex学术数据库中的作者与机构信息有时并不完全准确,例如机构识别错误、作者与机构对应关系错误,或者将院系、地址、城市混入机构名称中。因此,后续会更加重视以下字段的区分:
- raw affiliation evidence;
- canonical institution name;
- city / region / country;
- coordinates;
- author–institution mapping;
- manual verification notes。
通过上述持续修正,尽量减少错误机构信息对地图展示结果的影响。