跳转到主要内容

目录

积累平时的代码

Github/编辑

名词解释 解释(代码引用示例之一) select * from table where a=3 limit 10;
备注信息:
流程图: (代码引用示例之二)

macbook配置

  • 汇总
原因:Github没有fork项目代码,或没加所在机器的sshkey(settings->deplot keys)

python使用mysql方法

安装方法

mac下安装MySQL-python 要想使python可以操作mysql,就需要MySQL-python驱动,它是python 操作mysql必不可少的模块。
  • 下载地址
  • 下载MySQL-python-1.2.5.zip 文件之后直接解压。
  • 进入MySQL-python-1.2.5目录:

连接mysql

shell 代码,shell脚本中调用sql脚本
或者shell脚本中直接执行sql

爬虫

python抓取链接二手房数据

json使用

shell中使用json

  • #[2016-12-31] shell中使用json
  • 安装:
pip install git+https://github.com/dominictarr/JSON.sh#egg=JSON.sh
  • 使用:
详情参考:https://github.com/dominictarr/JSON.sh

可视化

地图数据可视化

学习资料

返回目录

学习技巧

  • @爱可可-爱生活(新浪微博)
    • 互联时代怎么阅读?
    • 读书重在结构生长,形成扎实的支撑;
    • 碎片阅读重在视野的纳新和扩展,开枝散叶;
    • 思考重在提炼和关联,勾画错综的经脉。
    • 学习就是如此,由外而内,无广不精,无博不深,但能坚持必有所成。
    • 网络阅读的最佳实践,不在“取”,在“舍”,知舍才能知关键,料不在多,有感悟一二足矣。
  • 费曼技巧:通过向别人清楚地解说一件事,来确认自己真的弄懂了这件事。参考:号称终极快速学习法的费曼技巧,究竟是什么样的学习方法?
  • 费曼技巧
  • 学习金字塔
学习金字塔
  • 【2018-7-27】什么是博士?长图 什么是博士?

数学基础

返回目录 -【2018-9-4】Google出品:动图解释反向传播

计算机基础

分布式计算

推荐系统

  • 项量:关于LDA,pLSA,SVD和Word2vector的一些看法
    • SVD算法是指在SVD的基础上引入隐式反馈,使用用户的历史浏览数据、用户历史评分数据、电影的历史浏览数据、电影的历史评分数据等作为新的参数
    • LSA最初是用在语义检索上,为了解决一词多义和一义多词的问题,将词语(term)中的concept提取出来,建立一个词语和概念的关联关系(t-c relationship),这样一个文档就能表示成为概念的向量。这样输入一段检索词之后,就可以先将检索词转换为概念,再通过概念去匹配文档。在实际实现这个思想时,LSA使用了SVD分解的数学手段.x=TSD
    • PLSA和LSA基础思想是相同的,都是希望能从term中抽象出概念,但是具体实现的方法不相同。PLSA使用了概率模型,并且使用EM算法来估计P(t|c)和P(c|d)矩阵.LDA是pLSA的generalization:一方面LDA的hyperparameter设为特定值的时候,就specialize成pLSA了
    • NMF:一种矩阵分解,要求输入矩阵元素非负,目标和 SVD 一样。
    • pLSA:SVD 的一种概率解释方法——要求矩阵元素是非负整数。LDA:pLSA 加上 topics 的 Dirichlet 先验分布后得到的 Bayesian model,数学上更漂亮。为什么是 Dirichlet 先验分布,主要是利用了 Dirichlet 和 multinomial 分布的共轭性,方便计算。 plsa
    • 【2018-8-2】LDA:无监督,文本主题模型,pLSA的贝叶斯版本。【精】一文详解主题模型LDA简述LDA主题模型
    • lda
  • 从item-base到svd再到rbm,多种Collaborative Filtering(协同过滤算法)从原理到实现
  • 案例分享:世纪佳缘推荐系统经验分享
  • 《推荐系统实践》阅读笔记:LFM模型、图模型、slop one和SVD算法
  • 实时推荐系统
  • 【2019-04-22】从FM推演各深度CTR预估模型-含代码,覆盖CTR预估的前因后果,FM,DeepFM, NFM, DIN, AFM, DCN

机器学习

返回目录

特征工程

基本概念

算法总结

异常检测

  • IsolationForest。欺诈等是一系列的异常孤立点,而IsolationForest则是检测这类孤立点的一个有效算法。无需样本标记、线性时间复杂度。一般情况下要比OneClasSVM等表现要好。尤其是对非高斯分布的样本空间。
  • 【2017-7-31】反欺诈(Fraud Detection)中所用到的机器学习模型有哪些?
    • (1)可视化:相关矩阵+多维尺度变换
    • (2)算法模型:时序相关(时间序列分析)、时序无关(无监督学习Isolation Forest、监督学习one-class SVM、统计学密度估计)
  • 【2018-9-12】python异常检测工具包pydor,graph

机器学习经验总结

集成学习

流形学习

  • 什么是流形学习?传统的机器学习方法中,数据点和数据点之间的距离和映射函数f都是定义在欧式空间中的,然而在实际情况中,这些数据点可能不是分布在欧式空间中的,因此传统欧式空间的度量难以用于真实世界的非线性数据,从而需要对数据的分布引入新的假设。流形(Manifold)是局部具有欧式空间性质的空间,包括各种纬度的曲线曲面,例如球体、弯曲的平面等。流形是线性子空间的一种非线性推广。参考流形学习的简单介绍
  • 流形学习:本质上,流形学习就是给数据降维的过程。这里假设数据是一个随机样本,采样自一个高维欧氏空间中的流形(manifold),流形学习的任务就是把这个高维流形映射到一个低维(例如2维)的空间里。流形学习可以分为线性算法和非线性算法,前者包括主成分分析(PCA)和线性判别分析(LDA),后者包括等距映射(Isomap),拉普拉斯特征映射(LE)等。流形学习可以用于特征的降维和提取,为后续的基于特征的分析,如聚类和分类,做铺垫,也可以直接应用于数据可视化等。注:摘自集智百科流形学习(优质,包含代码及案例)
    • 拟合线性的流形学习模型:LLE, LTSA, Hessian LLE, 和Modified LLE
    • 拟合非线性的流形学习模型:Isomap,MDS和Spectral Embedding
    • 效果示意如下:降维效果
  • 浙大何晓飞的流形学习ppt,讲的很清楚,全面,最佳资料

降维

深度学习

返回目录

什么是神经网络

神经网络发展历史

神经网络网络结构变化

  • 网络结构变化历史 当然,光有强大的内在能力,并不一定能成功。一个成功的技术与方法,不仅需要内因的作用,还需要时势与环境的配合。神经网络的发展背后的外在原因可以被总结为:更强的计算性能,更多的数据,以及更好的训练方法。只有满足这些条件时,神经网络的函数拟合能力才能得已体现 -【2017-8-7】The mostly complete chart of Neural Networks, explained,神经网络结构大全
  • all type of nerual network
  • 发展外因
  • 【2019-04-30】神经网络3D仿真视频
  • 【2017-12-23】神经网络原理视频(十分直观形象),包含3部分,直观理解反向传播
  • 【2019-05-07】神经网络结构可视化

深度学习大牛

深度学习书籍

几本有名的书籍: -【2017-8-5】Neural Network and Deep Learning(神经网络与深度学习) full_stack

大神博客

案例及Demo

CNN

NLP自然语言处理&RNN

返回目录

RNN

语音

对抗生成学习

VAE和GAN,VAE和GAN

强化学习

返回目录

迁移学习

知识图谱

数据挖掘

返回目录

人脸识别

IT资讯

返回目录

工具

返回目录

实验评估

  • 第一种:A/B-Test. 什么是ab-test?
    • A/B Test,也称为对比测试,是让两个版本的登陆页面的相互pk测试。看看哪个版本能更好地引导访问者达到你的预设目标,如注册或订阅。
    • 工程实施:叫你如何对产品进行AB Test?,包含服务端、客户端如何实施ab-test,及各自的优缺点
  • ab-test有什么局限性?
    • 首先,A/B测试只有在关键效绩指标(KPI, or Key Performance Indicator)单一,且这个单一明确的目标可以被电脑量化时,适用
    • 其次,A/B测试相比起一些别的测试手段,如纸本原型(paper prototyping),需要的工作量大、时间长,对设计的要求也相对较高。
    • 另外,A/B测试之所以进行,唯一原因是对结果的追求。但相对应的测试结果通常是短期、即刻的用户行为,比如购买、注册、点击等。
    • 此外,A/B测试并不能提供用户行为的具体细节。A/B测试的结果也仅限于被测试的两个选项:如果12号字比16号字为你的网站带来多1%的用户浏览时间,那10号字呢?8号呢?A/B测试并不能帮助你作更多的、长远的决定。
    • A/B测试还有别的缺点:需要的用户人数大,可能的影响因素多,可以测试的选项数有很大限制等等。
  • 吆喝科技-ab-test最佳实践
  • 第二种:interleaving,参考美团分享的文章沈国阳:美团推荐系统整体框架与关键工作.
    • abtest的好处是可以对多个策略给出定量评估,坏处是:①策略差异小时,评估结果波动大②需要较长时间反馈,导致迭代速度慢
    • 改进:interleaving,所需流量小,灵敏度高(24h内),但只能给出定性结论。基本思想是将两个策略混合,对所有用户统计分析判断哪个好
    • 【2018-6-22】优质资源,多图解释Innovating Faster on Personalization Algorithms at Netflix Using Interleaving
  • 灰度发布和A/B Test

编程语言

返回目录

视频资源

返回目录

公开课

Comments