每一轮跑批的诊断
点开任意一轮,看漏斗卡在哪、错在哪一层、元凶是谁、改哪里最值; 再点开单个达人,一路看到 Prompt A 的原始标注。全部从已存的中间结果算,零模型调用。
| 轮次 | 要求 | 规则 | 漏斗 | 过线率 | 错在哪一层 | 调用 |
|---|
跑批记录
每个 run 冻结了当时的参数、公式、Prompt 版本。改完东西从这里重跑,然后去「对比」看变好还是变坏。
| # | 数据集 | 要求 | 起始阶段 | 状态 | 出分 | 视觉/文本调用 | 参数版本 | 准确率 |
|---|
不一致案例
AI 判定跟品牌反馈对不上的号。点开看四阶段中间结果,定位到底是标注错了、阈值卡错了、规则判反了还是权重不对。
| 类型 | 达人 | 推荐分 | 调性 | 品牌反馈 | AI结论 |
|---|
判定参数
阈值、权重、收缩系数、推荐线。改完保存会生成新版本(旧版本永不删除),然后回「跑批」从 S2 重跑——零模型调用、秒级出结果。
派生指标公式
改指标的算法定义。先在已有标注上预览影响面,确认再保存——预览不落库、不花钱。
Prompt 库
改 Prompt A 会让所有标注缓存失效、必须从 S1 全量重跑(贵);改 Prompt B 只需从 S3 重跑(便宜);改 Prompt 0 只影响之后新编译的要求。
两次跑批对比
改动到底有没有效果,只能靠这一页回答。没有对比,"好像好了点"永远说不清是哪一下改好的。
反馈闭环
汇总前台使用者的认可、不认可和待复核反馈;分数与人工结论冲突的案例会单独标出,作为下一轮参数、Prompt 和模型迭代的输入。
| 达人 | 反馈 | 推荐分 | 实际结论 | 问题原因 | 操作人 | 备注 |
|---|
版本发布
发布会冻结当前参数、公式、三个 Prompt 和模型路由(不保存 API Key)。回滚会原子恢复整套配置,并写入审计日志。
不可变发布快照
| 版本 | 名称 | 配置快照 | 模型路由 | 说明 | 创建 |
|---|
审计日志
发布、回滚和使用者反馈都会留痕,便于复盘真实反馈如何驱动版本迭代。
| 时间 | 动作 | 对象 | 操作人 | 原因 |
|---|
浏览器采集 · 直接采集与文件上传
工作台可直接批量采集 1~100 位达人,也可上传已有的 29 列 .xlsx。平台登录态只留在运营的专用浏览器里,服务端不保存 Cookie,也不读取 Cookie 明文。
| 数据 | 从哪里取 | 是否需要登录态 |
|---|---|---|
| 个人标签、内容标签、最近笔记 ID、官方公开链接 | 蒲公英页面 | 需要,仅使用浏览器现有会话 |
| 最近 8 篇的封面、标题和正文 | 小红书公开笔记页 | 不需要,不发送小红书 Cookie |
| 29 列审号输入 | 直接采集或上传现有 .xlsx | 两种方式都会保存为可重复选择的数据集 |
采集与交接规则
| 现象 | 原因 | 怎么办 |
|---|---|---|
| 缺少个人标签或内容标签 | 蒲公英页未登录或接口未返回 | 在专用浏览器里重新登录蒲公英后继续采集 |
| 缺少封面或正文 | 公开笔记被删除、设为私密或页面结构变化 | 采集器标记失败,不要生成不完整行 |
| 个别标题为空 | 原笔记没有可提取标题 | 允许为空,不阻塞导入 |
| 列数或列名不一致 | 上传文件不是固定格式 | 按页面提示重新导出 29 列文件 |
模型配置
没配 API 时系统自动走离线模拟,整条链路照样能跑通(结果带「模拟」角标)。 拿到 API 后在这里填上、测通,切成真模型即可,其余代码和配置一律不动。
成本参考
按 200 个达人估算,帮你决定并发和是否先小样本试跑。
| 阶段 | 调用次数 | 说明 |
|---|---|---|
| S1 标注 | 200 × 8 = 1600 次视觉 | 最贵的一步;命中缓存不重复计费 |
| S2 派生 | 0 | 纯代码 |
| S3 裁决 | 200 次文本 | 不传图,只传结构化数据 |
| S4 算分 | 0 | 纯代码 |
| 标准答案 | ≤200 次文本 | 品牌反馈解析,只跑一次 |
调阈值/权重从 S2 或 S4 重跑 —— 调用次数为 0。 改 Prompt B 从 S3 重跑 —— 只花 200 次文本。只有改 Prompt A 才需要重烧那 1600 次。