跑批记录

每一轮跑批的诊断

点开任意一轮,看漏斗卡在哪、错在哪一层、元凶是谁、改哪里最值; 再点开单个达人,一路看到 Prompt A 的原始标注。全部从已存的中间结果算,零模型调用。

轮次要求规则漏斗过线率 错在哪一层调用

跑批记录

每个 run 冻结了当时的参数、公式、Prompt 版本。改完东西从这里重跑,然后去「对比」看变好还是变坏。

#数据集要求起始阶段状态 出分视觉/文本调用参数版本准确率

不一致案例

AI 判定跟品牌反馈对不上的号。点开看四阶段中间结果,定位到底是标注错了、阈值卡错了、规则判反了还是权重不对。

类型达人推荐分调性品牌反馈AI结论

判定参数

阈值、权重、收缩系数、推荐线。改完保存会生成新版本(旧版本永不删除),然后回「跑批」从 S2 重跑——零模型调用、秒级出结果。

派生指标公式

改指标的算法定义。先在已有标注上预览影响面,确认再保存——预览不落库、不花钱。

Prompt 库

改 Prompt A 会让所有标注缓存失效、必须从 S1 全量重跑(贵);改 Prompt B 只需从 S3 重跑(便宜);改 Prompt 0 只影响之后新编译的要求。

两次跑批对比

改动到底有没有效果,只能靠这一页回答。没有对比,"好像好了点"永远说不清是哪一下改好的。

反馈闭环

汇总前台使用者的认可、不认可和待复核反馈;分数与人工结论冲突的案例会单独标出,作为下一轮参数、Prompt 和模型迭代的输入。

达人反馈推荐分实际结论问题原因操作人备注

版本发布

发布会冻结当前参数、公式、三个 Prompt 和模型路由(不保存 API Key)。回滚会原子恢复整套配置,并写入审计日志。

不可变发布快照

版本名称配置快照模型路由说明创建

审计日志

发布、回滚和使用者反馈都会留痕,便于复盘真实反馈如何驱动版本迭代。

时间动作对象操作人原因

浏览器采集 · 直接采集与文件上传

工作台可直接批量采集 1~100 位达人,也可上传已有的 29 列 .xlsx。平台登录态只留在运营的专用浏览器里,服务端不保存 Cookie,也不读取 Cookie 明文。

正在读取采集契约…
数据从哪里取是否需要登录态
个人标签、内容标签、最近笔记 ID、官方公开链接蒲公英页面需要,仅使用浏览器现有会话
最近 8 篇的封面、标题和正文小红书公开笔记页不需要,不发送小红书 Cookie
29 列审号输入直接采集或上传现有 .xlsx两种方式都会保存为可重复选择的数据集

采集与交接规则

现象原因怎么办
缺少个人标签或内容标签蒲公英页未登录或接口未返回在专用浏览器里重新登录蒲公英后继续采集
缺少封面或正文公开笔记被删除、设为私密或页面结构变化采集器标记失败,不要生成不完整行
个别标题为空原笔记没有可提取标题允许为空,不阻塞导入
列数或列名不一致上传文件不是固定格式按页面提示重新导出 29 列文件

模型配置

没配 API 时系统自动走离线模拟,整条链路照样能跑通(结果带「模拟」角标)。 拿到 API 后在这里填上、测通,切成真模型即可,其余代码和配置一律不动。

成本参考

按 200 个达人估算,帮你决定并发和是否先小样本试跑。

阶段调用次数说明
S1 标注200 × 8 = 1600 次视觉最贵的一步;命中缓存不重复计费
S2 派生0纯代码
S3 裁决200 次文本不传图,只传结构化数据
S4 算分0纯代码
标准答案≤200 次文本品牌反馈解析,只跑一次

调阈值/权重从 S2 或 S4 重跑 —— 调用次数为 0。 改 Prompt B 从 S3 重跑 —— 只花 200 次文本。只有改 Prompt A 才需要重烧那 1600 次。