收藏一下大牛的数据挖掘学习经验

zoukankan html css js c++ java

收藏一下大牛的数据挖掘学习经验
只是过来人，说点看法：
基础篇：
1. 读书《Introduction to Data Mining》，这本书很浅显易懂，没有复杂高深的公式，很合适入门的人。另外可以用这本书做参考《Data Mining : Concepts and Techniques》。第二本比较厚，也多了一些数据仓库方面的知识。如果对算法比较喜欢，可以再阅读《Introduction to Machine Learning》。
2. 实现经典算法。有几个部分：
a. 关联规则挖掘 (Apriori, FPTree, etc.)
b. 分类 (C4.5, KNN, Logistic Regression, SVM, etc.)
c. 聚类 (Kmeans, DBScan, Spectral Clustering, etc.)
d. 降维 (PCA, LDA, etc.)
e. 推荐系统 (基于内容的推荐，协同过滤，如矩阵分解等)
然后在公开数据集上测试，看实现的效果。可以在下面的网站找到大量的公开数据集：http://archive.ics.uci.edu/ml/
3. 熟悉几个开源的工具: Weka (用于上手); LibSVM, scikit-learn, Shogun
4. 到 https://www.kaggle.com/ 上参加几个101的比赛，学会如何将一个问题抽象成模型，并从原始数据中构建有效的特征 (Feature Engineering).
到这一步的话基本几个国内的大公司都会给你面试的机会。
进阶篇：
1. 读书，下面几部都是大部头，但学完进步非常大。
a.《Pattern Recognition and Machine Learning》
b.《The Elements of Statistical Learning》
c.《Machine Learning: A Probabilistic Perspective》
第一本比较偏Bayesian；第二本比较偏Frequentist；第三本在两者之间，但我觉得跟第一本差不多，不过加了不少新内容。当然除了这几本大而全的，还有很多介绍不同领域的书，例如《Boosting Foundations and Algorithms》，《Probabilistic Graphical Models Principles and Techniques》；以及理论一些的《Foundations of Machine Learning》，《Optimization for Machine Learning》等等。这些书的课后习题也非常有用，做了才会在自己写Paper的时候推公式。
2. 读论文。包括几个相关会议：KDD，ICML，NIPS，IJCAI，AAAI，WWW，SIGIR，ICDM；以及几个相关的期刊：TKDD，TKDE，JMLR，PAMI等。跟踪新技术跟新的热点问题。当然，如果做相关research，这一步是必须的。例如我们组的风格就是上半年读Paper，暑假找问题，秋天做实验，春节左右写/投论文。
3. 跟踪热点问题。例如最近几年的Recommendation System，Social Network，Behavior Targeting等等，很多公司的业务都会涉及这些方面。以及一些热点技术，例如现在很火的Deep Learning。
4. 学习大规模并行计算的技术，例如MapReduce、MPI，GPU Computing。基本每个大公司都会用到这些技术，因为现实的数据量非常大，基本都是在计算集群上实现的。
5. 参加实际的数据挖掘的竞赛，例如KDDCUP，或 https://www.kaggle.com/ 上面的竞赛。这个过程会训练你如何在一个短的时间内解决一个实际的问题，并熟悉整个数据挖掘项目的全过程。
6. 参与一个开源项目，如上面提到的Shogun或scikit-learn还有Apache的Mahout，或为一些流行算法提供更加有效快速的实现，例如实现一个Map/Reduce平台下的SVM。这也是锻炼Coding的能力。
到这一步国内的大公司基本是想哪去哪，而且待遇也不差；如果英语好，去US那边的公司难度也不大了。

其他大牛的经验总结：
A：
实际的项目中：
1. 首先就是要明确你希望挖的东西能产生什么业务价值，而非用什么挖掘算法，那是手段，可以在后面再关注；要能够具体描绘你的挖掘目标、价值，以及挖掘成果的预期展现形式，说服力如何，等等；
2. 其次，和相关的小伙伴讨论，为了挖出你想要的成果，需要利用到哪些数据？这些数据中，哪些是已经有的，哪些还得想办法去收集？其中是否有些数据根本是不可能收集到的？这些收集不到的数据对于你想挖的成果会有什么影响？如果是致命影响，直接导致你的挖掘成果缺乏说服力，那就此歇菜，另找其他方向吧。反之，则安排计划和资源，把能收集到的数据尽快收集起来；
3. 再次，根据收集到的数据的特点和收集过程的质量情况，清洗收集到的数据；
4. 根据挖掘目标的情况和收集到的数据的特点，制定挖掘规划，选择合适的挖掘算法；
5. 然后，就开始挖吧；
6. 第一轮挖完，看看成果如何？有道理吗？有说服力吗？大多数情况，你会发现，哦，晕，忘了应该把这几个因素考虑进去了，还应该加进去这几方面的数据才能看出来。好，继续转向第2步，继续收集数据、清洗、调算法/参数，挖出来后再评估，一般情况得这么循环N个回合；
7. 马马虎虎出来个差不多靠谱、勉强能自圆其说的初胚，这个成果看上去像那么回事儿了。
8. 总结一个说法（分析成果）出来，为了你的说法，把数据再针对性地洗上几遍，给出一个更加干净的分析成果，这个版本基本上有说服力了。
9. 讲究一点的，再画个信息图什么的，图文并茂，就可以初步交作业了；
10. 在真实的项目中，还有一步，就是选取重要的评估视角和指标，根据具体的业务特点，把你的分析过程做成每周/每日/每小时都能给个角度固定的分析报告的服务。
11. 再往前一步，如果你对这块业务真的很熟的话，还可以针对不同类型的分析结果，能给出相应的建议应对措施（Action），这样这此挖掘的业务价值就真正明确了。你做的活儿也没有停留在“活儿”这个份儿上，而是决策支持这个级别上了。
12. B：
查看全文

相关阅读:
MS-data
Lammps命令与in文件
 VMD建模得到模型
 VMD-合并模型与生成data文件
 VMD-水溶液中注入离子
 水分子模型
 1.MD相关概念
 Python7
python6
python5

原文地址：https://www.cnblogs.com/AmatVictorialCuram/p/4172820.html