十万Telegram号码不应被视为一个文件,而应被视为一项有样本、有分片、有波次和停止条件的生产任务。先用代表性数据验证格式、字段和异常,再逐级扩大;任何阶段的回连或错误率失控,都暂停下一波,而不是为了完成进度继续堆结果。
先盘点十万条的组成
按国家、来源、获取月份、客户阶段和号码质量计数。列出原始行数、唯一号码、缺少国家证据、重复、异常长度和已退出记录。未修改的“十万”通常包含大量不应提交的行。
抽取黄金样本
| 样本部分 | 目的 | 组成 |
|---|---|---|
| 正常层 | 验证基本schema | 各主要国家/来源 |
| 困难层 | 观察异常处理 | 旧格式、边界长度、重复 |
| 已知层 | 合理性检查 | 少量内部已知记录 |
| 否决层 | 验证流程拦截 | 退出、无用途记录 |
任务选择决定输出宽度
TG筛开通只需手机号和是否开通;TG筛活跃可包含UserID、用户名、离线时间、活跃天数、姓名、VIP和冻结;性别年龄再增加头像URL、年龄和性别等。十万规模下,多一列意味着更多覆盖、解析和治理成本,不能默认选最宽任务。
分片规则先于文件大小
先按平台任务与国家规则隔离,再按来源和风险切分。每片有固定batch_id、输入唯一数、TXT hash与预期schema。不要让一个高异常来源拖垮其他片,也不要为了凑整万混合不同任务。
用四个波次扩大
| 波次 | 建议范围 | 放行条件 |
|---|---|---|
| 0 | 黄金样本 | 字段、状态、回连正确 |
| 1 | 约1%的分层样本 | 异常率可解释 |
| 2 | 约10%的生产数据 | 吞吐和复核不积压 |
| 3 | 剩余合格分片 | 预算与SLA仍成立 |
TXT生成的控制点
爱普筛TXT一行一个手机号,无表头、姓名或业务标签。生成器输出crosswalk、行数、唯一数、编码与hash;文件一旦提交不再修改。修复异常形成新版本和新batch,不覆盖原文件。
容量验收看端到端
分别记录清洗、等待、处理、下载、schema验收、回连与人工异常的P50/P95时间。十万号码全部返回但复核积压一周,不算容量通过。service_rate必须包含“可用观察已入库”。
质量验收按层报告
总体回连率会掩盖小国家或脏来源。按样本层报告明确结果、未知、input_error、system_error、字段空值和映射冲突。任一关键层跌破阈值,停止该层扩容而非用大层平均。
失败恢复只处理受影响分片
系统错误使用attempt_id重试,格式错误回到规范化,schema错误整片隔离,业务未知不无限重跑。幂等键防止同一Excel重复导入;每次重试保留先前响应。
人力容量也要压测
测量每百条异常需要多少分钟、一天能关闭多少冲突、谁负责升级。若人工队列增长速度高于处理能力,立即降低波次或缩小任务字段。自动吞吐不能替代人力预算。
关闭前做一次反向抽样
从已接纳、未知、异常和排除四类中各抽样,追溯到原始行与处理理由;再从CRM随机抽取结果,反向确认来自正确batch而非旧Excel。发现一类系统性错误时,暂停关闭并评估全部同类分片,不以样本量小为理由忽略。
十万任务何时算完成
输入唯一数等于被接受、未知、异常、错误和排除的可解释总和;每片有schema与hash;可用结果已按时间写入观察表;临时文件有删除日期。完成不是进度条到100%,而是数量账和责任账同时闭合。
