直接回答:Semantic Scholar 适合用来发现论文、沿参考文献与后续引用扩展线索、整理 Library,并用 Research Feed 跟踪近三个月的新论文。正确用法不是输入一条超长检索式后相信排序,而是把研究问题拆成概念组,运行多轮短查询,用年份、领域、文献类型、作者或期刊会议筛选,再回到 DOI、出版方页面和论文全文核验。它的 TLDR、Ask This Paper、引用意图与 Highly Influential 标签都是机器生成或模型预测的导航信号,不能替代阅读全文、研究质量评价和系统综述检索。
本指南面向第一次使用 Semantic Scholar 的中文学生、研究者和工程师,也适合需要建立可复现文献发现流程的团队。资料于 2026 年 7 月 16 日按官方产品页、官方 FAQ、教程与 API 文档复核。旧版文章中“支持 AND/OR/NOT”“引用量等于论文质量”“AI 摘要可以代替阅读”等表述均已撤回;官方 FAQ 当前明确说明网页搜索不支持 Boolean 运算符或通配符,只支持引号短语。

Semantic Scholar 是什么,不能替你做什么?
Semantic Scholar 是 Ai2 提供的免费、AI 驱动学术文献搜索与发现工具。它把论文元数据、作者、参考文献与被引关系组织成学术图谱,并在部分记录上提供 TLDR、论文资源、引用意图、推荐和阅读辅助。官方产品教程说明,用户可以按论文、作者、主题或关键词搜索,并以领域、日期、文献类型、作者、期刊或会议进一步筛选。
| 任务 | Semantic Scholar 能提供 | 仍需你核验 | 不能据此下结论 |
|---|---|---|---|
| 发现论文 | 相关性排序、筛选、作者与场所入口 | 检索覆盖、同义词和遗漏 | 排名靠前就是最好证据 |
| 快速初筛 | 标题、摘要、TLDR、资源链接 | 全文、方法、样本与结果 | 一句摘要代表全部结论 |
| 追踪关系 | References、Citations、引用分类 | 引用上下文与引用态度 | 被引就是被支持 |
| 管理线索 | Library、文件夹、导出与 Feed | 版本、去重、引用格式 | 导出的题录必然无误 |
| 程序访问 | Academic Graph API 与数据集 | 许可、速率、字段与第三方权利 | 所有全文和数据都可任意商用 |
把它理解成“发现层”更准确:搜索结果可以帮你找到种子论文,却不保证覆盖某领域的全部证据;免费访问搜索页面,也不等于所有论文全文免费。官方 FAQ 说明,Semantic Scholar 无法替出版方授予全文权利,用户可能需要通过作者、出版方或机构订阅获取文章。对医学、法律或公共政策等高风险结论,不要把搜索排名或 AI 摘要当作专业判断。关于 AI 生成文本为什么需要外部核验,可同时参考本站的AI 幻觉识别与事实核查指南。
第一步:先把研究问题拆成可以搜索的概念组
不要从一句含有十几个限定词的自然语言问题开始。先写清“研究对象、方法或干预、结果、场景、时间边界”,再为每个核心概念列出全称、缩写和同义词。Semantic Scholar 官方 FAQ 提醒:除作者名外,系统通常不会自动扩展缩写和首字母词,因此只搜 RAG 可能漏掉只写 retrieval-augmented generation 的记录。
| 概念组 | 示例 | 为什么单独列 | 首轮动作 |
|---|---|---|---|
| 方法 | retrieval augmented generation、RAG | 缩写未必自动扩展 | 全称与缩写分别查询 |
| 应用 | medical question answering、clinical QA | 同一任务有不同表述 | 与方法词交叉组合 |
| 结果 | factuality、hallucination、accuracy | 结果指标可能不写在标题 | 第二轮用于缩小范围 |
| 设计 | benchmark、randomized、evaluation | 区分观点文与实证研究 | 初筛后再补,不先锁死 |
| 边界 | 2023–2026、Medicine | 属于筛选条件而非核心概念 | 优先用界面筛选器 |
网页搜索不支持 AND、OR、NOT 和通配符,所以不要把其他数据库的检索式直接粘贴过来。可以用引号锁定短语,例如 "retrieval augmented generation" medical question answering,随后分别运行缩写、同义词和更宽泛的版本。每一轮只改变一到两个变量,才能知道结果变化来自哪里。
中文课题应该用中文还是英文检索?
检索语言应由研究领域和论文实际用词决定,而不是由读者母语决定。对国际计算机科学、医学和自然科学课题,先从英文全称、缩写与学科术语建立主查询,再用中文术语补充中文论文;对中国政策、本土教育、中文语料或地区性案例,中文名称、官方文件用语、旧称和英文译名都应分别运行。不要假设系统会自动把中文概念完整翻译成所有英文同义词。
| 课题类型 | 主查询语言 | 必须补充 | 核验重点 |
|---|---|---|---|
| 国际技术方法 | 英文全称与标准缩写 | 旧称、模型名、任务名 | 论文版本与会议期刊 |
| 中国政策与治理 | 中文官方术语 | 英文译名、发布机构和文件号 | 原始政策页面与生效日期 |
| 中文数据与 NLP | 中英文并行 | 数据集名称、拼音或历史名称 | 语言、地区和许可边界 |
| 医学问题 | 英文医学术语为主 | 全称、缩写、疾病旧称与受控词 | 专业数据库、注册平台和指南 |
一个实用办法是先从两到三篇已知可靠的种子论文抽取作者真实使用的术语,再反向更新概念组。新增术语必须写进日志,不能悄悄覆盖旧查询;否则团队无法区分“第一次没有搜到”和“后来改变了检索式”。如果中文和英文结果集合差异很大,分别记录数量、筛选和纳入理由,不要把两个集合混成一个无法复现的总数。
| 轮次 | 查询示例 | 目的 | 何时停止或回退 |
|---|---|---|---|
| 1:宽搜 | "retrieval augmented generation" medical |
观察领域用词和代表性论文 | 噪声过多时增加任务词 |
| 2:缩写 | RAG clinical question answering |
覆盖只写缩写的记录 | RAG 歧义太多则改用全称 |
| 3:结果 | medical RAG factuality hallucination |
聚焦事实性评估 | 结果过少时移除一个结果词 |
| 4:种子扩展 | 进入关键论文的 References/Citations | 发现关键词未覆盖的关系 | 新论文不再改变主题图谱 |
第二步:正确使用筛选、排序和论文页面
搜索后先记录未筛选结果数量与日期,再逐项应用过滤条件。官方教程列出的常用筛选包括领域、日期范围、文献类型、作者、期刊与会议;排序可见相关性、引用量、影响性和新近程度。排序回答的是“系统如何组织候选”,不是“哪篇研究最可靠”。新论文引用少很正常,老论文引用多也可能只是领域基础、争议焦点或方法被频繁批评。
| 控件 | 适合解决 | 常见误用 | 记录方式 |
|---|---|---|---|
| Field of Study | 减少跨学科同名词噪声 | 把交叉学科论文全部排除 | 保存所选领域及未筛选数量 |
| Date Range | 追踪新进展或限定研究期 | 只看近两年却讨论历史结论 | 写具体起止年 |
| Publication Type | 区分综述、临床试验等 | 相信自动类型绝对准确 | 到出版方页面复核 |
| Author / Venue | 追踪团队或会议期刊 | 把声望当方法质量 | 记录作者身份与场所名称 |
| Sort | 切换相关、新近或被引视角 | 只看第一页 | 记录排序项和查看深度 |
进入论文页面后,先核对标题、作者、年份、发表场所、DOI 或其他标识符,再读摘要与全文。官方Semantic Reader 页面说明,增强阅读功能主要覆盖大部分 arXiv 论文,功能可用性会因论文而异。页面上出现代码、演示、临床试验或媒体资源只是关联线索,仍要检查来源和版本。
| 页面区域 | 可以回答 | 必须继续问 | 建议动作 |
|---|---|---|---|
| 标题与作者 | 记录可能是哪篇研究 | 是否同名作者、作者是否合并错误 | 核对 ORCID、机构或作者主页 |
| 摘要 / TLDR | 是否值得进入全文初筛 | 方法、限制和条件是否被省略 | 定位全文方法与结果段 |
| References | 作者建立在哪些先前工作上 | 关键基础证据是否被遗漏 | 向后追踪并记录纳入原因 |
| Citations | 哪些后续论文引用了它 | 是支持、复现、扩展还是反驳 | 阅读引用上下文 |
| Resources | 可能的 PDF、代码、数据与演示 | 是不是正式版本、许可是否允许使用 | 回到原始托管方核验 |
TLDR、Ask This Paper 和引用标签怎样用才安全?
TLDR 官方说明把它定义为自动生成的单句摘要,当前主要覆盖计算机科学、生物学和医学中的部分论文。它适合在几十条结果里做相关性初筛,不适合复制成论文结论。若 TLDR 与摘要或结果段不一致,以原文为准,并记录你引用的是哪个版本。
Ask This Paper 只在部分论文上提供。官方 FAQ 说明该功能用论文内容与用户问题生成回答,已测试范围主要是英文论文,并明确提醒生成式 AI 可能产生细微或严重事实错误。官方发布记录也把它描述为带支持语句的实验性问答入口。支持语句便于定位,不代表模型已经正确解释实验条件。
| 信号 | 合理用途 | 不能证明 | 最低核验 |
|---|---|---|---|
| TLDR | 判断是否值得读摘要与全文 | 研究结论完整、准确 | 摘要、结果、限制三处对照 |
| Ask This Paper | 定位方法、结果或术语线索 | 回答没有遗漏或幻觉 | 点击支持语句并读上下文 |
| Cites Methods/Results/Background | 缩小要检查的引用集合 | 引用态度一定是支持 | 打开引用论文的原句 |
| Highly Influential | 优先探索可能重要的图谱连接 | 论文质量、真实性或共识 | 研究设计与独立复现 |
| Citation Count | 观察传播和学术关系 | 效果大小、证据等级 | 按年份、领域和引用语境解释 |
Semantic Scholar 的学术图谱与机器学习方法有公开研究背景,可阅读Semantic Scholar 文献图谱构建论文、S2ORC 语料论文和Open Data Platform 论文。这些资料能解释系统如何构建,但不能保证某一条记录在今天没有缺失、合并或版本错误。
用 References 与 Citations 做前后向追踪
关键词检索容易漏掉术语不同但问题相同的论文。选出一篇方法透明、与问题高度相关的种子论文后,向后检查 References 找理论与基础方法,向前检查 Citations 找复现、扩展、修正和反驳。官方教程提供在引用集合中继续按关键词、日期、类型、作者、场所和领域缩小结果的操作。
| 方向 | 主要问题 | 优先找 | 风险 |
|---|---|---|---|
| 向后:References | 这项工作建立在什么证据上 | 原始方法、数据集、量表、关键定义 | 作者选择性引用 |
| 向前:Citations | 后来如何使用或评价它 | 独立复现、更大样本、不同场景、纠错 | 引用不等于支持 |
| 作者追踪 | 团队是否有连续研究 | 后续版本、数据与勘误 | 同名作者或档案合并 |
| 场所追踪 | 主题在哪些会议期刊演进 | 专题、同年竞争方法 | 场所声望替代质量判断 |
建议给每篇候选论文写一句“为什么纳入”,例如“提供外部验证数据”“复现种子研究但样本更大”;排除时也记录“只有社论、没有原始数据”“人群不符”等原因。这样能防止只保留支持预设结论的论文,也方便同事复核。
Library、文件夹和 Research Feed 怎么设置?
登录后可把论文保存到 Library、自定义文件夹、批量导出引用,并把文件夹用于 Research Feed。官方产品页建议先在同一文件夹放入主题相近的论文,再对不相关推荐做负反馈;官方给出的“5 篇相关、3 篇不相关”是产品使用建议,不是所有课题都必须满足的科学阈值。Feed 每日刷新,FAQ 当前说明推荐候选来自 Semantic Scholar 语料中最近三个月发表的论文。
| 文件夹 | 放什么 | 反馈规则 | 不建议混入 |
|---|---|---|---|
| 核心方法 | 直接回答同一方法问题的种子论文 | 只保存真正相关的正样本 | 泛泛新闻与不同任务论文 |
| 应用场景 | 同一技术在医疗、教育等单一场景 | 按场景拆分 Feed | 多个差异巨大的领域 |
| 评估与风险 | 基准、偏倚、安全、失败案例 | 保留反面和无效结果 | 只支持预设观点的论文 |
| 待核验 | 身份、版本或全文未确认的记录 | 核验后移出 | 作为 Feed 正样本长期保留 |
Library 文件夹默认是私密的;设为公开后,任何拿到链接的人可见文件夹名称、描述和论文列表,若创建者已认领作者页,还可能显示创建者姓名。需要协作分享前应阅读Ai2 隐私政策中的 Semantic Scholar 专项说明,不要在文件夹名或描述中写患者、客户、未公开项目或研究对象的敏感信息。站内团队知识沉淀可参考AI 知识管理落地指南。
全文、开放获取和引用导出要分开核验
“搜索免费”“记录显示 PDF”“文章是开放获取”是三件不同的事。某条记录可能只有题录和摘要,也可能链接预印本、作者手稿或出版社定稿。引用前要确认你实际阅读的版本、发布日期、页码或章节,以及是否存在更正或撤稿。
| 看到的状态 | 可能含义 | 核验路径 | 写作时怎样标注 |
|---|---|---|---|
| View PDF | 存在可访问副本 | 检查托管域名、版本和许可 | 引用实际阅读版本 |
| DOI | 持久标识符指向登记记录 | 出版方页面与Crossref 元数据 | 核对作者、年、题名 |
| arXiv / preprint | 同行评审前或独立版本 | 找期刊或会议定稿及版本差异 | 明确写“预印本” |
| Cite 导出 | 系统生成 BibTeX/APA 等格式 | 对照目标引用规范和原始题录 | 不要未经检查直接提交 |
| 无全文 | 权利或收录范围限制 | 作者主页、机构订阅或出版方 | 未读全文时降低断言强度 |
官方产品页列出 BibTeX、MLA、APA 与 Chicago 等导出格式,但格式可选不代表字段一定正确。作者顺序、会议录信息、卷期页码、在线优先日期和 DOI 都应在原始出版页面复核。不要用引用量替代期刊影响因子,也不要用期刊指标评价单篇论文。
Semantic Scholar 与其他检索入口怎样分工?
不存在适合所有课题的“最强文献导航仪”。工具选择取决于覆盖领域、可复现检索语法、受控词表、引文索引、机构权限和导出需求。下面按角色分工,不给未经同题实测的主观评分。
| 入口 | 更适合 | 核心补位 | 不能互相替代的原因 |
|---|---|---|---|
| Semantic Scholar | 跨领域发现、引用网络、AI 初筛与推荐 | 种子论文和前后向追踪 | 网页布尔检索与系统综述覆盖有限 |
| PubMed | 生物医学与生命科学 | MeSH 等领域检索能力 | 领域覆盖和索引规则不同 |
| Crossref | DOI 与出版元数据核验 | 标识符、题录和关系元数据 | 不是以全文相关性阅读为中心 |
| 机构订阅数据库 | 正式系统检索与引文分析 | 可复现语法、字段和授权全文 | 覆盖、许可和检索字段不同 |
| 出版方 / 学会 | 确认最终版本、勘误、撤稿和补充材料 | 原始发布事实 | 通常只覆盖自身内容 |
如果目的是系统综述,Semantic Scholar 可以辅助找种子与补漏,但不应作为唯一数据库。PRISMA 2020要求透明报告信息来源和检索过程,Cochrane Handbook 第 4 章也讨论多来源检索、试验注册和去重等要求。具体数据库组合应由学科、研究设计和协议决定。
怎样保存一份别人可以复现的检索日志?
最低限度记录研究问题、概念组、每条原始查询、检索时间与时区、筛选器、排序方式、结果数量、查看深度、种子论文标识符、纳入排除理由和独立核验来源。只写“在 Semantic Scholar 搜过”无法复现,也无法判断后来结果变化是语料更新、排序更新还是查询改变。
| 字段 | 合格示例 | 不合格示例 | 用途 |
|---|---|---|---|
| 查询 | 完整复制两轮查询文本 | 搜了 RAG 相关内容 | 复跑与比较 |
| 时间 | 2026-07-16T17:20:00+08:00 | 昨天 | 解释动态结果差异 |
| 筛选 | 2023–2026;Medicine;相关性 | 最新论文 | 重建结果范围 |
| 种子身份 | 题名 + DOI/S2 ID/URL | 那篇综述 | 去重与版本核验 |
| 排除原因 | 人群不符;无原始数据 | 感觉没用 | 控制选择偏差 |
本次改写附带本地脚本 semantic-scholar-search-log.py,用于检查 JSON 检索日志是否具备必填字段。它不上传数据、不调用 Semantic Scholar,也不声称判断检索是否完整;它只把“可复核记录”变成发布前的机械闸门。团队还应建立研究问题级的保留集与复核责任人,思路可参考AI 平台评估方法和AI 可用性测试指南。
开发者怎样安全使用 Academic Graph API?
Academic Graph API提供论文、作者、引用和场所等图谱数据。官方API 教程给出的基础路径是 https://api.semanticscholar.org/graph/v1,论文详情可按 paper ID 查询;批量搜索另有筛选与分页方式。实际字段、认证和速率以当前 API 参考为准。
curl --get \
"https://api.semanticscholar.org/graph/v1/paper/DOI:10.48550/arXiv.2301.10140" \
--data-urlencode "fields=title,year,authors,externalIds,citationCount"
| 工程项 | 最低要求 | 错误做法 | 验收证据 |
|---|---|---|---|
| 身份 | 优先保存 DOI、S2 paperId 与来源 | 只用易变标题匹配 | 标识符映射日志 |
| 字段 | 只请求任务需要的 fields | 默认抓取一切 | 字段清单与用途 |
| 分页 | 记录 token/offset 和终止条件 | 把第一页当全集 | 页数、总量与重试记录 |
| 限速 | 尊重响应与文档,退避重试 | 并发轰炸或绕过限制 | 状态码、退避与失败率 |
| 密钥 | 放环境变量或密钥管理器 | 提交仓库、日志和截图 | 泄漏扫描 |
| 权利 | 逐项核对 API、数据集及底层内容许可 | 把“开放资源”理解成无限制商用 | 许可版本与归属记录 |
API 页面可提供图谱记录,不自动授予底层出版内容的权利。开发或商用前阅读官方 API 许可页和具体数据集 README;许可版本或入口可能变化,需保存你接受的条款日期。接口接入只是数据工程起点,不是证据质量保证。需要设计可审计提示与输出结构时,可参考本站Prompt Engineering 工程指南;理解语义检索底层概念可阅读自然语言处理入门与应用。
常见问题与排查清单
| 问题 | 可能原因 | 先做什么 | 仍未解决 |
|---|---|---|---|
| 结果太少 | 只搜缩写、短语太长、筛选过严 | 用全称,移除一个结果词或筛选 | 换数据库并做引文追踪 |
| 结果太杂 | 缩写歧义、跨领域同名词 | 加完整任务词并限定领域 | 从可靠种子进入引用集合 |
| 找不到全文 | 权利、收录或版本限制 | 检查 DOI、作者页、机构订阅 | 联系作者或图书馆 |
| 元数据错误 | 自动抽取、版本合并或来源差异 | 与出版方和 Crossref 对照 | 通过官方反馈渠道报告 |
| Feed 不相关 | 文件夹主题混杂、反馈不足 | 拆文件夹并标记不相关 | 重建主题更窄的 Feed |
| 没有 TLDR/Ask | 功能只覆盖部分论文或语言 | 直接读摘要和全文 | 不要把缺少功能当论文缺陷 |
Semantic Scholar 要注册吗?
搜索和访问论文记录不要求注册;Library、文件夹、Research Feed、提醒和个性化功能需要登录。公开分享文件夹前检查隐私设置。
它能代替 Google Scholar、PubMed 或机构数据库吗?
不能一概替代。它在跨领域发现、引用图谱和推荐方面很方便,但不同入口的覆盖、字段、检索语法、受控词表与许可不同。正式综述按协议组合多个来源。
为什么不建议用 AND、OR、NOT?
因为 Semantic Scholar 官方 FAQ 当前明确说网页搜索不支持 Boolean 运算符或通配符。使用短语引号、多轮查询和界面筛选器,并保存每轮查询。
引用多或 Highly Influential 就是高质量吗?
不是。它们可以帮助确定探索优先级,但论文质量要看研究设计、数据、统计、偏倚、适用边界、复现和后续更正。引用还可能是背景介绍、方法使用或批评。
可以直接引用 TLDR 或 Ask This Paper 的回答吗?
不建议把生成文本当论文原话。应定位到论文原文,核对上下文、版本和具体结果,再引用原始研究;找不到对应原文时不要强化结论。
发布前的五分钟核验
- 查询是否包含全称、缩写和关键同义词,并明确没有假设 Boolean 生效?
- 是否记录查询原文、日期、筛选、排序、结果数和查看范围?
- 关键论文是否核对 DOI、作者、年份、版本、勘误或撤稿?
- 每个结论是否来自原文而非 TLDR、Ask This Paper 或引用量推断?
- 若声称“全面”“系统”,是否按学科协议搜索多个数据库和注册平台,并公开排除理由?
结论:Semantic Scholar 的最佳价值不是替你宣布“哪篇论文是真的”,而是快速建立一张可继续验证的文献关系图。把多轮检索、前后向引文追踪、Library/Feed、独立元数据核验和可复现日志连起来,它会成为高效的研究入口;跳过全文与方法审查,它就只是一个排版友好的候选列表。
