TG筛性别年龄的验收重点,不是Excel里“有多少男、多少女”,而是样本能否代表目标数据、每列覆盖是否透明、未知是否被诚实保留。年龄与性别等结果可能来自有限公开线索或推断,适合在批准范围内观察群体分布,不应被当作某个个人的身份证明。
先写研究问题,再决定是否需要画像
“想多拿一些字段”不是研究问题。合格问题可以是:不同获客来源的可观察画像覆盖是否存在明显差异,是否值得为两种创意各做一轮小规模测试。若结果不会改变素材、语言或预算,画像任务没有必要执行。
验收样本必须分层
从真实名单按国家、来源、录入月份、号码质量和客户阶段分层抽样。每层保留输入基数,避免高质量老客户占据大部分样本。若某层记录太少,应报告置信不足,而不是把它与大样本层混合后给出看似精确的比例。
| 样本层 | 为何单独观察 | 最低记录 |
|---|---|---|
| 国家/区号 | 格式与覆盖可能不同 | 有效输入与未知均计数 |
| 获客来源 | 公开资料丰富度不同 | 保留来源原始占比 |
| 新旧批次 | 时间会影响状态 | 记录录入与检测日期 |
| 异常格式 | 区分输入问题与字段缺失 | 单独异常层 |
先验收基础身份列
爱普筛TG性别年龄任务可导出手机号、TG UserID、tg用户名、用户离线时间、活跃天数、First Name、Last Name、是否TG VIP、是否冻结,以及头像URL、年龄、性别等字段。第一步是确认手机号能回连输入、UserID与用户名不被混为一列、时间字段可解析、布尔状态编码一致。
画像字段要有三态甚至四态
性别或年龄不能只保留“男/女”和数字。至少区分有结果、未知、不适用、处理错误;年龄可按获批的宽区间使用,并保留原始空值。把未知强行分配给最大类别会提高覆盖率,却会系统性扭曲小群体。
分别计算分母
| 指标 | 正确分母 | 不能说明 |
|---|---|---|
| 回连率 | 有效唯一输入 | 画像准确 |
| UserID覆盖 | 可回连结果 | 账号归属 |
| 性别覆盖 | 适用且可处理记录 | 个人真实身份 |
| 年龄覆盖 | 适用且可处理记录 | 精确出生年龄 |
| 头像覆盖 | 可观察账号 | 照片属于持有人 |
检查缺失是否集中发生
总体覆盖70%可能隐藏某个国家只有20%。制作国家×来源、来源×批次的缺失矩阵;若未知集中在某一层,业务报告必须注明偏差,不能用有结果的子集推断整个名单。验收阈值也应按层定义,而不是只有一个全局数字。
用人工样本评估“可解释性”
人工复核不需要证明每个画像字段真伪,而是检查结果能否追溯、空值是否一致、字段字典是否被遵守、同一记录重复运行是否出现无法解释的跳变。复核人员看不到不必要的客户身份信息,记录判断理由而不是复制公开头像。
分层规则只服务于群体实验
画像结果可以帮助比较两套中性素材在不同观察群体中的整体表现;不应决定价格、信用、就业、账号封禁或个体是否值得服务。小样本层不单独投放,敏感或可能造成歧视的组合不创建。
为字段设置寿命与访问范围
用户名、离线时间、头像和推断画像都会变化。保存checked_at、source_task、confidence_or_unknown与delete_after,过期后停止用于分层。只让执行获批分析的角色访问,原始URL和细粒度画像比聚合报表更早删除。
一份可签字的验收结论
结论应列出各层输入、异常、回连、字段覆盖、未知模式、重复测试差异和允许用途,并明确不能从结果推断什么。通过验收不是宣布数据“真实”,而是确认它在限定时间、限定样本和限定决策中足够透明、可控。
