把散落的文件,
变成可核对的企业资产
装在你自己机器上的资料管家。AI 把资料读一遍、分好类、写好简介, 证据不足的地方转人工,核对过的才入库。整个过程数据不出内网。
文件不是不存在,是找不到、对不上、不敢用
合同、证照、检测报告、项目资料,散在十几个文件夹和几个人的电脑里。 要用的时候翻不出来;翻出来了又说不清是不是最新版;想让 AI 帮忙看看,又不敢把资料传出去。
读一遍 → 判一次 → 存下来
读一遍
PDF 提正文并对扫描页抽样 OCR;Word / Excel / PPT 提结构化文字与内嵌图片;图片做视觉识别;音频转写;视频同时取语音和代表画面。
判一次
AI 判断该不该入库,并且要拿出证据——解析器确认内容被完整读取、模型确实看过对应模态。证据不足或置信度不到线,一律转人工,不猜。
存下来
内容按 SHA-256 去重,同一份文件从多处导入会保留全部来源记录。入库要生成内容简介,简介同时进全文检索索引。
它具体能做什么
全格式内容解析
不按扩展名判断,按内容读。PDF、Office 三件套、图片、音频、视频都在解析范围内,解析结果落库后可全文检索。
AI 审核 + 证据门禁
不是让模型说一句"通过"就算。服务端会独立重算证据是否充分,模态没覆盖、解析没读完、置信度不够,统统转人工。
内容寻址与来源追溯
同一份文件只存一份,但从哪些位置导入过全部留痕。复制入库,不移动、不删除你的源文件。
语义分类
一级按文件类型,二级按内容语义。分类会复用已有类目;不确定就标成待人工分类,不会硬塞一个。
AI 对话与工作成果
可以跨多份已入库资产做研究、比较、归纳,把结论落成独立的工作成果文档,随时下载。模型只读正式入库资产,不能改分类、不能删。
人工审核队列
待审项集中处理,可快捷通过;排除必须填理由并确认。排除历史只留审核元数据,不留文件副本。
关系图谱
按库、一级类型、语义子类分层展示关联,待分类资产单独标出,不假装它已经有业务关系。
敏感文件保护
.env、私钥、凭据和疑似令牌文件会被盘点到、标记出来,但默认不复制。系统目录、缓存、回收站、版本控制内部目录直接跳过。
现在还没有的
这一节比上面那节更重要。下面这些是当前版本确实做不到的, 写在这里,是为了让你在了解它之前先知道它的边界。
内测阶段的已知边界
- 还没有多用户身份与权限体系 —— 是单机版本,不是协同平台
- 不支持远程访问 —— 服务只监听本机环回地址,外网连不进来
- 没有灾备与异地备份 —— 数据在你本机,备份要你自己做
- AI 置信度尚未校准 —— 模型给出的业务结论必须由人复核
- 部分能力只是接口预留 —— 时效更新、资产责任人、可信来源、异盘备份目前是模块契约与界面占位,尚未连接任何企业系统
- 旧版 Office 格式需另装组件 —— DOC / XLS / PPT、ODF、RTF 需要额外安装 LibreOffice 才能解析
- 抽样检查有范围 —— 超出抽样范围的页面或画面可能没被读到,索引里会写明抽样说明
- 分类可能不准 —— 低置信度会标成待人工分类,最终要靠人确认
装在你自己的机器上
127.0.0.1。审核请求发往本机运行的模型,不把资产正文发送到云端。