读论文方法论
先站在整体层面读,建立整体概念框架
再深入小领域/单论文去读,比如三遍阅读法
判断论文是否值得 follow/论文应该有的字段
- 社区活跃性(github 的 fork 和 star)
- 研究可拓展性,可复制性
- 客观评价:顶会顶刊/是否 oral
读论文资源
- 关于论文学习资源的合集论文学习资源合集
- CVPR2026的论文分布及follow 建议
- 一些可能有帮助的科研skill
学习方法论
名词解释/论文分享
对于一个名词,可以将它的悬浮窗脚注分为以下三部分
- 是什么:分类|来源➕简短/一句话定义|严格定义➕实例/图例➕别称
- 怎么做:实现方法/实现路径/代表工作
做PPT的时候同样用这个思路,如:
- 0825做的大模型能力拓展的ppt=是什么➕为什么
- 大组会分享一篇论文
新闻/时事/自媒体/多媒体
关注新闻六要素(5W1H):
- When 时间
- Where 地点
- Who 人物
- What 事件
- Why 原因
- How 经过/如何
定义
要有自己的论文数据库观念
- 多篇论文地去读——遍历顶会顶刊的高引论文|highlight
- 结构化地去读——将一篇论文看作可以结构化的一条记录,针对 X 问题,论文提出 Y 方法,通过 Z 机制,实现了 W 改进
- 可以看作是层级分类(X 问题中有 Y 方法簇,Y方法簇有若干种Z 机制)
- 可以看作是无监督任务,进行聚类和降维,也可以通过有监督看看别人的 taxonomy
How to Read a Paper-S. Keshav说:不要把每篇论文都当教材。对大多数论文:
- 第一遍筛掉:看Abstract(摘要)、Introduction(研究背景)、Figure(所有图片)、Conclusion(结论),回答研究了什么?为什么重要?对我的课题有没有帮助?
- 第二遍以 Figure 为中心,读懂所有图
- 第三遍像 Reviewer 一样读:不是记住作者说了什么,而是不断追问:为什么这样设计实验?有没有更好的模型?统计方法合理吗?还有哪些混杂因素?如果让我接着做,下一步研究什么?
-
顶级会议:
名称 方向 说明 NeurIPS ML · 多模态 表征学习、自监督学习论文的重镇;多模态表征学习常见于此。 ICML ML 机器学习综合顶会,表征学习论文数量大。 ICLR 表征学习 名称直接包含 Representations,表征学习论文最集中的会议之一。 CVPR CV 表征学习聚焦视觉领域的主场,包括对比学习和自监督视觉预训练。 ICCV CV 视觉领域顶会,自监督视觉预训练论文集中。 ECCV CV 视觉领域顶会。 ACL NLP NLP 表征学习,包括词向量、句子表征和预训练语言模型。 EMNLP NLP NLP 实证方法顶会,预训练语言模型论文密集。 NAACL NLP ACL 北美分会,NLP 表征学习论文集中。 AAAI AI 综合性人工智能顶会。 KDD 图 · 数据 偏应用和数据挖掘,图表征学习常见于此。 -
顶级期刊:
名称 方向 说明 JMLR ML 机器学习权威开源期刊。 TPAMI CV 视觉和表征学习方向权威期刊。 Nature Machine Intelligence ML Nature 旗下人工智能期刊。 Machine Learning ML Springer 机器学习期刊。 -
论文浏览与合集资源:
名称 类型 说明 papers.cool 论文浏览 按会议和年份浏览,支持关键词搜索和 PDF 下载;GitHub 仓库。 ICLR 2025 VizHub 可视化 将 ICLR 2025 论文按语义相似度映射到二维空间,支持交互式探索。 -
⚠️论文数据库的一些借鉴方向(待深入)
| 项目数据源的名称 | 完整度 | 数据量 | 维护频率 | 论文覆盖数量及覆盖范围 | 使用建议 |
|---|---|---|---|---|---|
| AI Paper Trends | ★★★★★:综合覆盖最强之一,包含顶会 + 顶刊 | 约 159,732 篇;161 个 venue-year;7,483 个细粒度 topic | 高频 + 自动更新基础设施;有 weekly check | 覆盖 2020–2026;包括 ICLR、ICML、NeurIPS、CVPR、ICCV、ECCV、ACL、EMNLP、AAAI、IJCAI、ICRA 等,以及 TPAMI、IJCV、TIP、PR、JMLR、TNNLS、TKDE 等顶刊 | 当前最值得作为跨 venue 基础索引之一;适合作为主库候选,但如果要完整 paper-level 原始字段,仍建议结合 OpenAlex / DBLP / OpenReview |
| Papers With Notes | ★★★★☆:覆盖多个主流会议,论文级信息丰富 | 约 26,673 条;CVPR 2026 页面约 4,367 条 | 中高频、会议事件驱动型 | 覆盖 CVPR、ICCV、ECCV、ICLR、ICML、ACL、AAAI、NeurIPS 等多个会议和年份;可带 Paper、Code、中文/英文 Notes、Oral / Spotlight / Highlight 等标签 | 高价值增强源;适合补 Code、Notes、论文等级和主题,但入库前需要对 venue/type 做去重和官方校验 |
| [CV_Paper_Portal](https://github.com/hongsong-wang/CV_Paper_Portal) | ★★★★★:历史跨度和会议覆盖非常强 | 未公布统一论文总数,但覆盖大量 conference-year 页面 | 高频、长期维护型 | CVPR 2013–2026、NeurIPS 2009–2025、ICML 2015–2026、ICLR 2017–2026、AAAI 2017–2026,并覆盖 ICCV、ECCV、ACL、EMNLP、ICRA、IROS、RSS、SIGGRAPH 等 | 非常适合作为历史补全源;优势是跨度大,缺点是结构化程度一般,需要自己写 extractor 和去重流程 |
论文分布
| 大类 | 论文数 | 占比 |
|---|---|---|
| 视觉感知 | 1515 | 37.3% |
| 生成与多模态 | 1335 | 32.9% |
| 科学与跨学科 | 351 | 8.6% |
| 决策与具身 | 328 | 8.1% |
| 基础与理论 | 293 | 7.2% |
| LLM | 135 | 3.3% |
| 其他 | 105 | 2.6% |
| 合计 | 4062 | 100% |
| 排名 | 领域 | 数量 | 占比 |
|---|---|---|---|
| 1 | 3D 视觉 | 751 | 18.49% |
| 2 | 图像生成 | 490 | 12.06% |
| 3 | 多模态 VLM | 418 | 10.29% |
| 4 | 视频理解 | 187 | 4.60% |
| 5 | 视频生成 | 182 | 4.48% |
| 6 | 医学图像 | 172 | 4.23% |
| 7 | 自动驾驶 | 157 | 3.87% |
| 8 | 人体理解 | 151 | 3.72% |
| 9 | VLM Reasoning | 150 | 3.69% |
| 10 | 机器人/具身智能 | 146 | 3.59% |
| 11 | AI 安全 | 145 | 3.57% |
| 12 | 图像恢复 | 135 | 3.32% |
| 13 | 语义分割 | 122 | 3.00% |
| 14 | 模型压缩 | 108 | 2.66% |
| 15 | 其他 | 105 | 2.58% |
| 16 | 目标检测 | 99 | 2.44% |
| 17 | 自监督/表示学习 | 91 | 2.24% |
| 18 | VLM Efficiency | 63 | 1.55% |
| 19 | 遥感 | 63 | 1.55% |
| 20 | LLM Agent | 42 | 1.03% |
| 21 | 可解释性 | 34 | 0.84% |
| 22 | 幻觉检测 | 33 | 0.81% |
| 23 | 强化学习 | 25 | 0.62% |
| 24 | 音频/语音 | 22 | 0.54% |
| 25 | 优化/理论 | 22 | 0.54% |
| 26 | 计算生物 | 21 | 0.52% |
| 27 | 联邦学习 | 19 | 0.47% |
| 28 | LLM Reasoning | 16 | 0.39% |
| 29 | 对齐 / RLHF | 12 | 0.30% |
| 30 | LLM 安全 | 12 | 0.30% |
| 31 | AIGC 检测 | 10 | 0.25% |
| 32 | LLM 效率 | 8 | 0.20% |
| 33 | 图学习 | 8 | 0.20% |
| 34 | 异常检测 | 7 | 0.17% |
| 35 | 时间序列 | 7 | 0.17% |
| 36 | 预训练 | 5 | 0.12% |
| 37 | 因果推理 | 4 | 0.10% |
| 38 | LLM 其他 | 3 | 0.07% |
| 39 | 科学计算 | 3 | 0.07% |
| 40 | 社会计算 | 3 | 0.07% |
| 41 | Multi-Agent | 2 | 0.05% |
| 42 | 知识编辑 | 2 | 0.05% |
| 43 | 物理/科学计算 | 2 | 0.05% |
| 44 | 地球科学 | 2 | 0.05% |
| 45 | 信号/通信 | 2 | 0.05% |
| 46 | 医疗 LLM | 1 | 0.02% |
follow建议
| Top | 方向 | 推荐度 | 理由 |
|---|---|---|---|
| 1 | VLM Efficiency | 9.5/10 | 最匹配你的算力。围绕 token pruning、量化、蒸馏、PEFT、推理加速,不需要从头训练 VLM;7B 级开源模型即可做出完整实验。 |
| 2 | 3D Vision | 9/10 | 尤其是 Gaussian Splatting、重建、Novel View Synthesis。很多工作单卡即可训练,8×3090 足够大规模跑 ablation,而且 CVPR 论文量最大、研究活跃。 |
| 3 | Image Restoration / Low-level Vision | 8.5/10 | 去噪、去模糊、超分、低光等实验成本低,公开数据集成熟,训练周期短,非常适合快速迭代方法。 |
| 4 | AIGC Detection / AI Safety | 8/10 | 算力门槛非常低,主要研究检测、鲁棒性、泛化、Deepfake 等;真正难点在问题设计而不是堆 GPU。 |
| 5 | Detection / Segmentation | 7.5/10 | MMDetection、Detectron2 等生态成熟,实验非常标准化;8×3090 完全够,但领域成熟,单纯刷结构创新较难。 |
| 6 | VLM Reasoning | 7/10 | 潜在影响力更高,可以基于 Qwen-VL/LLaVA 等做 LoRA、数据策略、推理方法;但实验成本和竞争强度明显高于前五。 |
- 先对模型能力分类,定好分类学(这一步耗时最长)
- 对每种模型能力分述:简短/一句话定义➕实例/图例➕怎么做总述
- 对怎么做的分述:具体有哪些路径?是递进的还是并列的? - 对该类实现路径再进行“是什么”的分述
豆包都能讲的不要讲/快速讲
- X 任务:该篇文章面向的任务?文章认为的任务痛点是?任务现有的实现路径有哪些?
- Y 方法:该篇文章的一句话核心思路➕图例(是什么),接着深入核心思路的具体实现(怎么做)
- Z 效果:实验配置罗列,图表解释
讲更多我们自己的思考
- 论文本身的启发和思考:
- 综述层面:串联其他文章,在这个工作领域中的生态位
- 对于自己的工作:论文有什么值得我们借鉴的思路?
- 论文的含金量评估:
- 实验部分:实验是否全面?是否对比公平
- 如果是 oral?思考为何它值得 oral 的原因