Sciverse
返回生态API 文档
SCIVERSE ESSAY · PAPER SCHEMA

论文不再只能以全文形式一次性读入。Paper Schema 将问题、方法、实验与证据组织成可检索、可比较、可按需下钻的知识结构。

从论文叙事到可操作知识结构
从论文叙事到可操作知识结构
01 · 价值主张

Agent 缺少的不是更多文本,而是一条可以继续工作的论证骨架

今天的论文依然以人类连续阅读为中心。标题、摘要、方法、实验和讨论组成一条长叙事;真正的研究问题、核心贡献、方法组件与证据关系,需要读者自行重建。

全文切片解决了“在哪里出现”,却没有直接回答“论文解决了什么问题、方法由什么组成、实验如何支持结论”。研究 Agent 会在每次精读、对比和综述中重复完成这一步,并反复消耗上下文。

Paper Schema 的目标不是再生成一份摘要,而是把论文表达成可以检索、组合和核验的中间结构,同时保留返回原文段落、表格和引用的路径。

把“读懂论文”从一次性的上下文推理,变成可以复用的知识积木。
02 · 新的数据形式

位于论文元数据与全文之间

一篇论文被转换为五类相互连接的对象。上层 Agent 不必猜测长文本中的隐含结构,而可以根据任务直接选择需要的材料。

Paper
论文主题、研究问题、核心贡献与主要结果。
Entity
Problem、Component、Finding、Measure、Resource 等科学对象。
Relation
对象之间的 uses_component、evaluates、supports、resolves 等论文内部关系。
Evidence
公式、表格、实验结果、比较结论、代码与数据资源。
Provenance
把结构对象和证据精确带回对应的原文位置。

Paper Schema 不是全文替代品,也不是自动写作黑盒。它提供原子材料,由 Agent 根据任务继续组合。

03 · 渐进式披露

不是把全文压缩得更短,而是让 Agent 决定下一步打开什么

面对一篇论文,Agent 可以从最小信息开始,只在问题需要时逐层增加上下文。

从概览到证据再到原文,信息只在需要时逐层展开。
从概览到证据再到原文,信息只在需要时逐层展开。
  1. 01先看论文卡片标题、主题、研究问题、核心贡献和主要结果。
  2. 02再看结构对象只读取当前任务相关的 Problem、Method、Dataset、Measure 或 Finding。
  3. 03继续查看关系与证据理解方法如何解决问题、实验如何评估方法、结果支持什么结论。
  4. 04最后回到少量原文只为最终采用的证据补充对应段落与邻接上下文。
04 · 能力与规模

从发现论文,到读取结构、核验证据与准备研究材料

当前paper-schema提供的能力通过 9 个 Agent 意图工具组织为六类能力。

发现论文
按关键词、DOI、作者、venue、年份和资源状态寻找已完成 Schema 抽取的论文。
读取对象
查看论文内部的 Problem、Component、Finding、Measure 与 Resource。
理解关系
查询论文内部对象之间的逻辑和实验关系。
核验证据
搜索公式、表格、结果和资源,并按 provenance 回到有限原文。
查看引用
保留完整 Reference 列表,并对已解析论文扩展受限引用图。
准备材料
按 survey、benchmark、method、reproduction 目标裁剪 Agent 可消费的材料包。
100 万+
已完成 Schema 抽取的 AI 会议论文
18
公共 API 操作
9
Agent 意图工具
20 篇
单次 Materials 论文上限
50 项
单次批量上下文补全
05 · 使用场景

真正的价值,发生在agent使用过程中

下面四个场景列举了不同agent工作流使用Paper Schema进行消费的优势。

01

单篇论文结构化精读

研究者希望快速理解一篇论文解决的问题、方法组成、实验设计和主要结论。

Agent 先读取论文概览,再选择与当前问题相关的 Entity,沿 Relation 理解方法、实验与结论,只为决定性 Evidence 补取原文。阅读结果具有稳定结构,后续追问也不需要重新加载整篇论文。

  • 按任务选择对象
  • 沿关系理解论证
  • 结论回到原文证据
先结构、后证据、最后才打开必要原文。
先结构、后证据、最后才打开必要原文。
02

多论文方法对比与复现

多篇论文使用不同写法描述方法、数据、指标和实验条件,直接对读很难形成一致判断。

method 与 reproduction 材料包把 Problem、Method、Component、Dataset、Setup、Measure 和 Evidence 放进同一比较框架。代码、数据、超参数或实验语境的缺失会变成显式缺口,并进一步形成复现准备清单。

  • 统一比较维度
  • 区分方法与实验条件
  • 显式暴露复现缺口
异构论文被对齐为可以逐项核验的方法比较框架。
异构论文被对齐为可以逐项核验的方法比较框架。
03

使用Claude Science/书生端砚等智能体平台撰写科研综述报告

这是一个最常用的科研场景。研究者从一个问题出发,希望获得结构清晰、覆盖合理并且证据可核验的综述。

在智能体平台如:书生端砚中,安装paper schema skill,通过更广覆盖的元数据或语义检索负责发现候选论文;Paper Schema 负责结构化阅读、相关工作扩展、survey 材料编排和关键证据定位;agent 再据此组织方法路线、观点差异、证据强度与研究空白。

  • 广域检索负责召回
  • Paper Schema 负责结构与证据
  • 科研智能体 负责综合与写作
从多篇论文的结构对象与证据,编排出一份可核验的综述。
从多篇论文的结构对象与证据,编排出一份可核验的综述。
04

用 FrontierLens 从研究问题构建有证据的主题研究图

研究者输入一个问题,系统不一次性生成一张“全局知识图谱”,而是围绕当前会话检索种子论文,逐步展开论文结构、跨论文联系和可回溯证据。

FrontierLens 调用 Paper Schema 搜索论文,并读取每篇论文的 Paper、Entity、Relation、Evidence 与已解析 Citation。用户先在主题图中识别研究路线,再打开论文结构和关系,最后沿 Evidence 的 provenance 返回原文段落核验结论。整个过程保留来源和边语义,让“发现—理解—核验”发生在同一条研究链路中。

Shannon4Science/sciverse-frontier-lens
01

从研究问题开始,生成当前会话的研究导读

输入“目前有哪些提高 Transformer 模型推理速度的方法?”后,FrontierLens 先生成检索规划,搜索种子论文并组织卡片式阅读路径。研究者可以同时看到当前图谱规模、导读论文数量和主题边界,先判断这次研究覆盖了什么。

主题研究页:研究问题、检索规划、论文规模与卡片式阅读路径同时呈现。
主题研究页:研究问题、检索规划、论文规模与卡片式阅读路径同时呈现。
02

在关系图中查看论文群落与研究路线

切换到关系图后,论文和研究对象按类别组织成可筛选网络。用户可以缩放图谱、控制类别显示、点击节点或关系检查来源,并导出当前会话子图,从整体结构中识别方法群落与连接路径。

主题关系图:把论文、语义关系与引用联系组织成有限会话图谱。
主题关系图:把论文、语义关系与引用联系组织成有限会话图谱。
03

打开论文,先读结构再读全文

从主题图选择一篇论文后,FrontierLens 读取 Paper Schema 中的 Entity 与 Relation,把方法组件、核心贡献、实验设置、关键结论和指标放到同一张论文结构图中。左侧导读帮助快速判断重点,右侧结构图支持继续下钻。

论文结构页:卡片导读与论文内 Entity–Relation 图并排展示。
论文结构页:卡片导读与论文内 Entity–Relation 图并排展示。
04

沿 Evidence 和 provenance 回到原文核验

选择关键 Entity 或 Evidence 后,原文证据面板依据 paragraph 或 marker provenance 定位对应段落。缺少精确定位时,产品会明确显示近似搜索或相关版本状态,而不是把推断伪装成原文事实。

原文证据页:结构对象、证据和来源段落保持同屏可追溯。
原文证据页:结构对象、证据和来源段落保持同屏可追溯。

FrontierLens 构建的是围绕当前研究问题的有限会话图谱,不等同于已经完成全局实体规范化、冲突治理和长期维护的领域知识库。Related Suggestion 是发现线索,不是事实关系;Citation Graph 也只包含已解析论文边。

06 · 能力边界

以下能力还在持续构建中

  • 01当前主要覆盖已完成 Schema 抽取的 100 万+ AI 会议论文;未命中不代表研究不存在。
  • 02跨论文 Entity 发现表示相似或相关,不代表已经完成全局身份对齐。
  • 03Citation Graph 只包含已解析论文边,不能替代完整引用数量。
  • 04Materials 是任务导向的有限材料,必须检查 returned、total 与 truncated。
  • 05完整系统综述仍需组合更广覆盖的检索;领域图谱仍需额外的规范化、治理和质量控制。