评估TG筛号工具时,“一万条用了多久”和“准确率多少”都不是完整问题。速度至少要拆成排队、处理、导出和异常重试;准确度则必须说明比较对象、样本来源、未知值和检查时间。没有这些定义,再漂亮的数字也无法复现。
先写测试声明,不先跑号码
声明要比较的服务、样本范围、批次大小、开始与结束时点、网络条件、通过标准以及不测试的内容。TG筛开通、TG筛活跃、TG用户名和TG全格式的字段数量不同,不能把一次全格式任务与一次开通任务直接比较吞吐。
样本必须覆盖真实异常
| 样本层 | 目的 | 至少记录 |
|---|---|---|
| 已知开通 | 检查漏报 | 确认来源与确认日期 |
| 已知未开通/待确认 | 检查误报与未知 | 不可把未回复当金标准 |
| 格式异常 | 验证拒绝原因 | 少位、多位、非法字符 |
| 多国家码 | 发现区域偏差 | 每个国家的分母 |
| 重复与映射冲突 | 测试幂等和主键 | 原始行与唯一号码 |
什么可以作为“金标准”
金标准应来自近期、可核验且用途允许的事实,例如测试团队自有并确认状态的号码。不要用“销售没有收到回复”定义未开通,也不要用另一家筛号工具的输出互相证明。对于无法可靠确认的记录,标为unknown并从正确率分子中分离,但仍保留在覆盖率分母中。
速度至少报告五个数字
- 输入行数与唯一号码数;
- 端到端总耗时;
- 每千个唯一号码的耗时;
- 批次p50与p95完成时间;
- 失败、超时和重试数量。
平均值会隐藏长尾。p95明显变慢时,运营团队感受到的是少数批次拖住交付,而不是漂亮的平均速度。
准确度不是一个字段的一个比例
TG筛开通实际返回手机号与是否开通;TG筛活跃可返回手机号、TG UserID、TG用户名、用户离线时间、活跃天数、First Name、Last Name、是否TG VIP和是否冻结。每个字段分别报告coverage、agreement、unknown和conflict,不能用“有返回”替代“返回正确”。
Telegram隐私设置会影响可见性解释
Telegram官方FAQ说明,用户可以控制Last Seen可见性,某些情况下只显示recently、within a week、within a month或a long time ago等近似区间。因此测试应按工具实际返回字段解释,不把不可见或近似状态包装成精确在线时间。
重复运行检验一致性和时效
将同一冻结样本在同一日重复一次,再隔预设时间运行一次。同日变化可以提示任务或映射不稳定;跨日变化可能是真实状态变化,不能全部算作错误。保存run_id、checked_at和字段级差异,才能区分系统一致性与数据时效。
容量测试要逐级上升
从小批量开始,逐级提高到日常批次和峰值批次,每一级只改变一个变量。记录机器、网络、并发、文件大小和服务类型。若使用代理或跨境网络,单独报告传输失败,避免把本地网络波动归因于筛号处理能力。
TXT与Excel也要纳入计时
爱普筛上传TXT,一行一个号码,结果导出Excel。测试从TXT准备完成开始计时,到Excel可被验收脚本读取结束,而不是只统计页面上的任务运行阶段。输入去重、异常分流、下载和解析都是企业真实等待时间。
建立明确的失败门槛
例如:格式异常必须有可解释原因;同日重复不应出现无法说明的大规模主键变化;未知值不得被自动改成否;失败批次可通过run_id安全重试且不重复写入CRM。门槛应在结果出现前确定,避免测试后挑选有利指标。
采购比较如何保持公平
所有候选工具使用同一冻结样本、同一字段定义、相近网络窗口和同一验收脚本。价格按“通过验收的唯一号码”而不是上传行数比较。若服务字段不同,就分别评价适用性,不能把字段更多直接写成更准确。
可信的TG筛号评估会留下可重复的测试包:样本说明、TXT哈希、任务类型、运行日志、Excel结果、字段级评分和异常清单。它给出的不是一句“很快很准”,而是在哪种样本、哪个字段和什么容量下表现如何。
