溯流

网站个人信息流向核验与合规研判智能体
停留:页面打开后继续观察多久。有些追踪组件是延迟加载的,停留越久抓得越全。
站内遍历:额外点进几个站内页面,触发首页之外的采集行为。
行业基线:与同行业站点比较接收方数量。.gov.cn.edu.cn 自动识别,其他站点需手动选,不选则不做比较。
抓取并比对隐私政策:找到该站隐私政策,抽取它声明了哪些接收方, 与实际观测逐一比对——这是核心检验。约多花 20 秒。
逐个说明接收方:为每个接收方生成通俗说明(是什么、这次拿到了什么、 对访问者意味着什么)。身份取自特征库,模型只负责措辞。
一次核验约需十几秒到半分钟——因为是真的把网站跑起来, 不是查数据库。
准备中
这个工具在做什么
你打开一个网站时,它可能在你不知道的情况下,把「有人来了、他从哪来、 用什么设备、正在看哪一页」发给另外几家公司。这件事没有任何界面会告诉你, 隐私政策里通常也不写具体是谁。

溯流把网站真正跑一遍,记录数据实际流向了谁、什么时候流出去的、 有没有先征得同意,再对照《个人信息保护法》给出研判, 并保留可回溯的毫秒级原始记录。
它在查什么
共 20 条规则,分两类。行为规则依据实际运行时观测:
检查项法律依据
有没有先取得同意就把数据发给第三方个保法 13、23 条
同意界面弹出之前,数据是不是已经发出去了个保法 13、23 条
第三方有没有写入长期跨站追踪标识个保法 6、23 条
有没有把数据传给境外接收方个保法 38、39 条
传出去的页面标题是否泄露健康、财务等敏感信息个保法 28、29 条
接收方数量是否明显高于同行业水平个保法 6 条
比对规则把隐私政策里的声明与实际行为对照,核心是一条: 第二十三条要求告知接收方的名称,实际观测到的接收方是否都被点了名? 笼统写「第三方合作伙伴」不算。
结果怎么读
报告给出的是线索,不是违法认定。分级表示核查优先级—— 核验资源有限时先看哪一条,不表示违法程度。所以写作「建议优先核查」 而不是「优先级 高」,后者容易被顺手读成违法程度。

报告最前面先给一条筛查结论:这一站要不要先看、为什么。往下才是 支撑它的事实。

建议优先核查 公开告知与实际数据行为存在明显差距,且涉及处理的合法性基础。
建议核查 涉及告知充分性、最小必要等限度要求。
可后续核查 需要进一步核查的义务履行情况。
需补充事实 观测证据不足以形成线索,需人工补充事实。

每条线索分三层:观测到的事实(访问端可见,附毫秒级原始记录,可自行核对)、 可能涉及(这些事实落在哪一类规范上)、还需核实(决定定性但访问端 看不到的事实)。你可以只采信第一层。
模型配置 检查中…
绝大多数功能不需要模型。取证、接收方归属、12 条行为规则、行业基线、 批量核验与全部报告,都由规则引擎完成,离线可用。
功能是否调用模型
运行时取证、同意时序、接收方归属
R01–R12 行为规则、行业基线、批量核验
报告生成与下载、数据流向图
抓取并比对隐私政策(P01–P07 规则),抽取政策中声明的接收方
逐个说明接收方,仅生成措辞,身份仍取自特征库
使用竞赛指定的 DeepSeek 官方接口,主用 deepseek-v4-flash, 输出异常时降级 deepseek-v4-pro 重试。
本服务只监听 127.0.0.1,密钥仅保存在本机进程内存中,不写入日志、 不通过接口回传;勾选「记住」才会写入项目根 .env, 该文件已被 .gitignore 忽略,不会进入版本库。 保存时会发一次极短请求校验连通性,校验不通过则不予保留。
取证方式与边界
以全新浏览器上下文模拟普通用户首次访问,记录运行时全部网络请求、 Cookie 写入与精确时序。遵守 robots.txt,不绕过任何技术保护措施, 不提交任何真实个人信息。

本次取证只覆盖实际访问到的页面与操作路径。取证以未登录状态进行, 而登录之后网站已经知道你是谁,可能把用户标识也传给第三方;未触达的 功能也可能存在其他数据流向。

接收方身份来自特征库(人工整理 157 条 + 公开追踪器数据库 4463 条), 未收录的一律标记为需人工确认,不作违法认定