问答文章1 问答文章501 问答文章1001 问答文章1501 问答文章2001 问答文章2501 问答文章3001 问答文章3501 问答文章4001 问答文章4501 问答文章5001 问答文章5501 问答文章6001 问答文章6501 问答文章7001 问答文章7501 问答文章8001 问答文章8501 问答文章9001 问答文章9501

如何通过自学,成为数据挖掘“高手”

发布网友 发布时间:2022-04-26 12:27

我来回答

1个回答

热心网友 时间:2022-04-10 22:35

基础篇:

1. 读书《Introction to Data Mining》,这本书很浅显易懂,没有复杂高深的公式,很合适入门的人。另外可以用这本书做参考《Data Mining : Concepts and Techniques》。第二本比较厚,也多了一些数据仓库方面的知识。如果对算法比较喜欢,可以再阅读《Introction to Machine Learning》。

2. 实现经典算法。有几个部分:
a. 关联规则挖掘 (Apriori, FPTree, etc.)
b. 分类 (C4.5, KNN, Logistic Regression, SVM, etc.)
c. 聚类 (Kmeans, DBScan, Spectral Clustering, etc.)
d. 降维 (PCA, LDA, etc.)
e. 推荐系统 (基于内容的推荐,协同过滤,如矩阵分解等)
然后在公开数据集上测试,看实现的效果。可以在下面的网站找到大量的公开数据集:http://archive.ics.uci.e/ml/

3. 熟悉几个开源的工具: Weka (用于上手); LibSVM, scikit-learn, Shogun

4. 到 https://www.kaggle.com/ 上参加几个101的比赛,学会如何将一个问题抽象成模型,并从原始数据中构建有效的特征 (Feature Engineering).

到这一步的话基本几个国内的大公司都会给你面试的机会。

进阶篇:

1. 读书,下面几部都是大部头,但学完进步非常大。
a.《Pattern Recognition and Machine Learning》
b.《The Elements of Statistical Learning》
c.《Machine Learning: A Probabilistic Perspective》
第一本比较偏Bayesian;第二本比较偏Frequentist;第三本在两者之间,但我觉得跟第一本差不多,不过加了不少新内容。当然除了这几本大而全的,还有很多介绍不同领域的书,例如《Boosting Foundations and Algorithms》,《Probabilistic Graphical Models Principles and Techniques》;以及理论一些的《Foundations of Machine Learning》,《Optimization for Machine Learning》等等。这些书的课后习题也非常有用,做了才会在自己写Paper的时候推公式。

2. 读论文。包括几个相关会议:KDD,ICML,NIPS,IJCAI,AAAI,WWW,SIGIR,ICDM;以及几个相关的期刊:TKDD,TKDE,JMLR,PAMI等。跟踪新技术跟新的热点问题。当然,如果做相关research,这一步是必须的。例如我们组的风格就是上半年读Paper,暑假找问题,秋天做实验,春节左右写/投论文。

3. 跟踪热点问题。例如最近几年的Recommendation System,Social Network,Behavior Targeting等等,很多公司的业务都会涉及这些方面。以及一些热点技术,例如现在很火的Deep Learning。

4. 学习大规模并行计算的技术,例如MapRece、MPI,GPU Computing。基本每个大公司都会用到这些技术,因为现实的数据量非常大,基本都是在计算集群上实现的。

5. 参加实际的数据挖掘的竞赛,例如KDDCUP,或 https://www.kaggle.com/ 上面的竞赛。这个过程会训练你如何在一个短的时间内解决一个实际的问题,并熟悉整个数据挖掘项目的全过程。

6. 参与一个开源项目,如上面提到的Shogun或scikit-learn还有Apache的Mahout,或为一些流行算法提供更加有效快速的实现,例如实现一个Map/Rece平台下的SVM。这也是锻炼Coding的能力。

到这一步国内的大公司基本是想哪去哪,而且待遇也不差;如果英语好,去US那边的公司难度也不大了。
声明声明:本网页内容为用户发布,旨在传播知识,不代表本网认同其观点,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。E-MAIL:11247931@qq.com
从焦作市到郑州快递一个羽毛球拍需用多少钱 iPhone X还能坚挺两年,升级到ios 15发热严重要靠红魔冰磁散热器 Peltier Module散热方式 一加18W冰点散热背夹-超强散热,极速降温 2015年春晚有哪些明星 新闻 如何评价央视主持人朱军?以及如何评价朱军所主持的《艺术 纯粮食白酒品牌大全,让你喝得放心(真正的纯粮食白酒有哪些品牌)_百度... ...工作单位要辞退并提出会给出相应赔偿,但合同马上到期,如到期后... ABC外语培训学校ABC教育集团总裁——刘成 abc是国产品牌吗?口碑如何? 如何通过自学,成为数据挖掘"高手 你通过自学,学到了什么技能? 王老师通过自学,掌握三四个国家的英语。(修改病句)? 可以通过自学参加高等教育考试吗? 如何通过自学成为一个学识渊博的人 日本豆腐是不是就是魔芋? 高中完全通过自学,难度有多大? 如何在短时间内通过自学考试? 通过自学的方式展开教育的活动是正确的吗 佳能80D-HDR怎么成灰色,原因在哪里? 佳能80D拍摄为什么前面的黄灯亮 佳能80D单反相机从取景器内看到右下方有个感叹号是什么原因 佳能80d,我拍照的时候闪光灯自动弹起,在盖就盖不起来了,是什么原因,求解答 佳能80D摄像档为何不能拍照 佳能80d相机拍摄照片照片上为什么有一个亮点 佳能80d撞了下,对焦都可以,但是摇晃镜头,前面有轻微声响,是坏还是没坏啊 现本人有佳能80D一台,纯新手,我会正常照相。在很暗的地方照相为什么开了闪光灯后按快门声不照相。 佳能80d用腾龙16-300镜头打开实时显示屏拍摄时,所有按键失灵,电源也关 佳能80D能拍照,但是拍完照后显示屏没有照片,是黑的,这是怎么回事? 佳能80d夜间开闪光拍领导,m档,按快门突然没反应了,拍摄不了,是怎么回事? 满天星该如何养殖? 满天星怎么种植,种植之后又该怎么办,我想放在盆里养,对于这些我一_百度... 为什么说近朱者赤近墨者黑 “近朱者赤,近墨者黑”怎么理解? 近朱者赤近墨者黑啥意思 近朱者赤近墨者黑是什么意思? “近朱者赤,近墨者黑”是什么意思? 怎么理解“近朱者赤近墨者黑”? 为什么说近朱者赤,近墨者黑? “近朱者赤,近墨者黑”怎么解释? 链工宝怎么在电脑上登录 链工宝学时证明怎么看 链工宝里的电工考试题库怎么调出来 “近朱者赤近墨者黑”怎么理解这句话呢? 链工宝里面档案信息怎么改 如何看待近朱者赤近墨者黑这两种观点 链工宝怎么在电脑上看 “近朱者赤,近墨者黑。”所包含的观点你有什么看法? 链工宝的在线考试是什么形式 一朋友给我发了一句近朱者赤,近墨者黑是什么意思