新闻动态¶
版本发布与功能亮点。完整变更日志见 GitHub Releases。
v0.9.0 — 丰富的文档输入与 chunk_rag 基线¶
- 📄 丰富的文档输入 —
he parse/he feed现在支持 PDF、Word、PowerPoint、Excel、HTML、CSV/JSON/XML、EPUB 等格式,安装可选依赖即可启用(pip install "hyperextract[ingest]",由 MarkItDown 驱动)。非 UTF-8 文本(GBK 等)自动识别编码;无文字层的扫描版 PDF 会给出明确的 OCR 提示,而不是静默摄入乱码。 - 🧱
chunk_rag基线方法 — 全新的零提取方法:文档直接分块并向量化,检索返回原始文本块。摄入零 LLM 成本,且具备完整溯源能力(标签、范围检索、按文档回滚)。语料问答与方法对比的块检索基线。 - 🐛 修复 —
he tag在所有知识库上都会崩溃(tag_source此前从未在任何类型上实现);he search/he talk/he feed/he remove --document在方法型知识库上会崩溃(method/*模板无法从元数据解析)。
v0.8.1 / v0.8.2¶
- 🏷️ 来源标签与范围检索 —
he tag ./ka/ --source doc-1 --add legal,然后he search ./ka/ "query" --tag legal即可只在已标注文档范围内检索。适用于 graph、hypergraph 和 set。(#89, #84) - 🛡️ 输入类型校验 —
he parse/he feed现在会拒绝不支持的文件类型并给出转换提示,而不是静默摄入乱码。(#88) - 📦 文档存档修复 — 同一来源换文件名重喂不再积累陈旧副本。(#89)
v0.8.0¶
- 🔄 文档级 Upsert — 对已标注的文档重新喂入时,旧版本贡献自动回滚:删除的事实消失,共享键从幸存来源重新合并。(#84)
- 📁 逐文件来源标注 —
he parse ./docs/自动按文件名标注来源;之后可回滚或审计任意单个文件。显式--source仍然优先。 - ⏱️ 时空溯源 — 时间/空间/时空图谱完整支持来源标注与回滚,并通过确定性的(MERGE_FIELD)回放测试。
v0.5.0 – v0.7.0¶
- 🗑️ 两级知识删除 — 按键硬删(
he remove --node/--edge,孤立边自动修剪),或通过 LLM 辅助编辑删除单条错误事实(he remove --edit-node --fact),支持 dry-run、键不变性检查与自动备份。(#84) - 📜 来源标注与溯源 —
he feed --source/he parse --source记录每个文档的原始贡献;he remove --document精确回滚单个文档的贡献;he info --sources展示来源账本。(#84) - 📈 全面增量 — feed/parse/删除/编辑均原地修补向量索引(仅重嵌入受影响的向量);内容哈希未变的文档自动跳过(
--refeed强制)。(#84) - 🧪
he template validate— 在为 LLM 调用付费之前发现模板语义错误:9 条诊断规则、--json输出接入 CI、--all扫描目录。(#77) - 📊 GraphML 与 CSV 导出 — 对接桌面图工具与表格软件;超图导出超边表。(#85)
- 🌐 OrcaRouter Provider — 一个 key 接入 150+ 模型(
create_client("orcarouter"))。(#71) - 🔐 配置文件权限 —
~/.he/config.toml以0600权限保存。(#86) - 🔗 Obsidian 双链修复 — 别名不再因
[ ] | # ^等字符出错。(#87) - 🛡️ Chunk 级故障隔离 — 单个 chunk 失败不再丢弃整个多 chunk 提取结果。(#78)
- ⚡ MCP Python SDK 2.x —
he-mcp同时兼容 mcp 1.x 与 2.x。(#72, #82) - 🔀 有向边修复 — 保留
(source, target)顺序;支持自定义端点字段名。(#74) - 🔑 DeepSeek API Key 修复 — OpenAI 兼容路径下正确识别
DEEPSEEK_API_KEY。(#76) - 🎓 教育领域模板 —
course_concept_graph+curriculum_structure。(#80) - 🧭 其他修复 — Graph_RAG.search 三元组;
he talk -i --top-k;引导与文档整体翻新。(#70, #73, #57)