数据质量之殇
经过大规模数据验证发现正确率(爬取的教师信息是否正确)和召回率(爬取到的教师占实际教师的比例)远不及预期,估计只有不到70%😢。经过一个星期的深入探索和分析,直接推翻了之前的整条技术路线重来(为了防止自己心痛暂时不去计算烧了多少金钱精力),并把数据质量提到爬虫系统架构中的最重要位置,把正确率和召回率的及格线定为99%。虽然新框架引入Agent会将成本提高一个数量级,但毕竟数据质量会直接影响功能价值,可能不但不能给用户带来价值,还起到完全相反的作用。
经过大规模数据验证发现正确率(爬取的教师信息是否正确)和召回率(爬取到的教师占实际教师的比例)远不及预期,估计只有不到70%😢。经过一个星期的深入探索和分析,直接推翻了之前的整条技术路线重来(为了防止自己心痛暂时不去计算烧了多少金钱精力),并把数据质量提到爬虫系统架构中的最重要位置,把正确率和召回率的及格线定为99%。虽然新框架引入Agent会将成本提高一个数量级,但毕竟数据质量会直接影响功能价值,可能不但不能给用户带来价值,还起到完全相反的作用。