LoreGraph 把小说、戏剧、剧本、歌剧脚本变成一张可查询的图谱:人物、物件、事件、概念,以及它们之间的有类型关系。每条断言都带一个 evidence_span,也就是原文里的一段字面文本。点开任意一条关系,就落到它出处的那一句。
多数从文本里抽知识图谱的工具,抽完三元组就让你相信它。对虚构作品来说这是致命的。LoreGraph 只守一条规则:每条抽取出的断言都带一个 evidence_span,也就是原文的字面子串;校验轮会丢弃字面匹配不到 95% 的断言。
工程实现参考了 Splink、ComEM 与 GraphRAG:字面证据闸门、跨字符集可用的实体消解、按轮提交与幂等重跑,以及不绑定单一厂商的模型客户端。
第 1、4 轮是确定性的,第 2、3、5、6、8 轮调模型,第 7 轮是闸门而不是建议。每轮各自提交,失败的一次用 --from N 续跑,不会重复写入。
确定性的章节感知切分,英文标题与「第N回」一样能识别。每个 chunk 都带一个全局故事时间位置。

抽有类型的提及,做实体消解(词面加向量 kNN 分块,再批量匹配)、共指、五类关系,以及它们隐含的常识事实。

chain-of-verification。证据跨度对不上原文字面的断言在这里被丢掉,门槛是 95%。

每个实体合成一张 Hybrid Note:事实与推断分栏,每条推断标注置信度,并给出子类型与重要性层级。

先 uv sync,对着装了 pgvector 的 Postgres 16+ 跑 alembic upgrade head,然后 loregraph ingest 加 loregraph extract。一把 OpenRouter key 就够。中等长度的长篇是分钟级而不是小时级,每本书还有 20 美元的预算上限,在轮次之间强制生效。