SIGNAL 01
软件 App · 竞品观察Carrot:只在数据合法可靠且结局成熟后发布国家级生育结果
Carrot 没把全球用户压成一张平均成绩单,而是为每个国家分别决定“哪些结果能算、何时可以发、该和谁比”。
关键机制 / 关键事实
- 报告跟踪 妊娠率、分娩率、单胚胎移植率、多胎妊娠率,并与用户实际接受治疗所在地的国家基准比较。
- 只有当当地数据能够合法、可靠地取得,且用户已经有现实时间走到治疗结局,才发布该国结果;不是先定统一发布日期再强行补齐数据。
- 在公共医保承担主要成本的国家,健康妊娠带来的财务收益未必直接回到雇主,Carrot 因此不硬算一个看似精确的“节省额”,而是先报告可验证的临床结果。
- 本条是 2026年8月26日的产品机制观察,不是伪装成今日发布。
🔗 同类做法对照: Carrot 2023 年的美国研究把会员结果与 SART 全国数据比较,并由 Milliman 独立验证方法,重点看单胚胎移植率、每次移植 IVF 妊娠率与 PGT-A 使用率。两版共同逻辑都是用真实治疗结果而非使用量证明服务价值;关键差异是旧版围绕美国的一套全国基准,新版承认各国监管、医疗支付、隐私和标准不同,把“什么能比较、什么时候能发布”也写进产品规则。价值不只是报告更细,而是避免用全球平均数制造虚假的可比性。
编辑视角海外母婴产品做跨地区分析时,真正可信的统一不是“一套指标走全球”,而是先统一指标的判定条件:定义是否相同、数据是否合法完整、结局窗口是否成熟、当地有没有有效基准。条件不齐时宁可标注不可比,也不要给出一个漂亮但误导的总数。
SIGNAL 02
AI 工具链 · 版本更新Claude Code:插件现在可用一条命令跑可复现评测并输出 JSON 与 HTML 报告
Claude Code 开始把插件从“装上能跑”推进到“发布前有一套可重复验收的题目和分数”。
关键机制 / 关键事实
- 2.1.269(9月11日)新增
claude plugin eval:直接运行插件自带的 eval suite,得到带评分、可复现的结果。
- 同一次运行同时输出 JSON 与 HTML 报告:JSON 便于接自动门槛,HTML 便于人阅读失败样本,不必只看一个总分。
- 2.1.270(9月12日)已成为最新版本,主要修复 2.1.269 导致只读 Git 命令偶发要求授权的回归;
plugin eval 能力仍保留。
- 这次更新关注的是插件整体交付是否稳定,不只是检查 manifest 或目录格式是否写对。
🔗 同类做法对照: OpenAI 的 Agent Evals 用完整 trace 记录模型调用、工具调用、guardrail 与 handoff,再用 graders、datasets 和 eval runs 找回归,适合已经运行的 agent 工作流。Claude Code 的共同逻辑也是把“感觉变好了”改成固定样本的可重复比较;关键差异是它把入口直接放进插件 CLI,让插件作者在发布前就能交付题目、评分和报告。OpenAI 更像运行中的质量实验室,Claude Code 更像插件包出厂前的质检台。
编辑视角Skill 或插件真正可复用,不只因为说明写得完整,还因为它带着自己的验收样本。以后改一条关键规则时,最有价值的不是再加更多提示,而是能回放几类典型成功与失败案例,证明新版没有把旧能力改坏。
选一个结果容易判定、近期刚修改过的 Skill,先把 5 个历史案例 + 明确通过条件写成最小 eval suite;只验证“改规则后是否退步”,不扩成全面评测工程。