花了一周时间完成了这个 assignment,记录了一下整个开发历程。
简单说来,就是给定一个数据集,然后做分类预测,预测的是文本和图片之间的相关性。但是这个数据集的特征非常有限,没有图片数据。
因为在短时间内抓取图片不现实,所以最后的方案就是在数据集做各种 feature engineering,embedding 对于整体提升非常大。
当然 overfitting 也比较明显,如果有更多时间,肯定需要在这方面下更多功夫。
如果大家有什么建议,也请赐教。
https://letters.acacess.com/ltr/
Post #270
417
DPS Build 说出来不怕笑话,花了点时间,找到了 bug。 之前的写法使用 pandas.Series.apply,按行处理,等于是把 GPU 当 CPU 用; 修复之后,用了 pandas 的向量化操作,性能成倍提升。原先10000条数据用了7分28秒才算完,用上 mps 之后,只要26.9秒,提升了16倍。