01 1 / 4
处理漏斗
六级漏斗把 4047 条原始吐槽压到 20 个机会:L1 规则过滤(71% 通过)→ L2 小模型二分类(25% 标为机会)→ L4 结构化抽取 → L5 跨源聚类成 304 个痛点簇 → L6 仅头部 6.6% 合成机会。
副标题点明成本控制逻辑——越往后越贵,前几级过滤率决定整体 LLM 账单。深色控制台用逐级缩水的数字条,一眼看清每档留存。
从公开噪音里筛值得做的痛点
内测闭源自用AI 原生SaaS开发者PainHunt 读论坛、应用商店差评这类公开吐槽,过规则过滤和模型抽取,聚成痛点簇,再打分排成短名单——回答「该不该做一个独立产品」,不是再给你一条信息流。
自用版先盯电商卖家工具、只采英文源;验收标准是每周能不能挖出几个「确实没想到又值得深挖」的点。
从源码读出的分层与一处真正独特的设计决策,不是截图复述。

公开源入 raw(不可变)后逐级变贵变稀:规则筛 → 本地小模型四分类 → blocker 抽取与向量聚类 → 仅头部做机会合成,输出周报短名单。
跳过前级直接喂大模型会让账单涨一到两个数量级——漏斗是成本前提。

只对一句 blocker 做向量,跨源才对齐得住。PainScore 与 OpportunityScore 刻意拆开:分得清「做不了的好机会」和「没人要的点子」。
### 新增:人工反馈标记(评测集来源) PRD 7.4 要求的「有价值 / 伪需求 / 已有成熟方案 / 误聚类」四类判定。;机会卡片与痛点簇卡片底部均可一点即标,再点撤销;POST /api/feedback,写入 pain_feedback;**伪需求 / 已有方案 / 误聚类**默认从机会列表隐藏(标记的意义就是挪出注意力),「有价值」保留高亮;列表上展示评测集计数;pnpm digest --export-eval 导出 JSONL 供后续调 L2/聚类/评分 这是长期数据壁垒的唯一来源——算法会变、prompt 会换,你亲自判定「这个值不值得」才是随时间