机器学习实战(用Scikit-learn和TensorFlow进行机器学习)(一)_机器学习实战基于scikit-learn和tensorflow-CSDN博客

一、简介

Scikit-learn集成了很多机器学习需要使用的函数，学习Scikit-learn能简洁、快速写出机器学习程序。本文章主要是对真实数据进行实战，手把手带你走一遍使用机器学习对真实数据进行处理的全过程。并且通过代码更加深入的了解机器学习模型，学习如何处理数据，如何选择模型，如何选择和调整模型参数。

二、配置必要的环境

1、推荐安装Anaconda（集成Python和很多有用的Package）

2、编辑器：Spyder 或 Pycharm 或 Jupyter Notebook

三、开始实战（处理CSV表格数据）

1、下载数据

数据集为房屋信息housing，代码运行后，会下载一个tgz文件，然后用tarfile解压，解压后目录中会有一个housing.scv文件（可以自行用excel打开看看），下载代码为：

import os
import tarfile
from six.moves import urllib
DOWNLOAD_ROOT = "https://raw.githubusercontent.com/ageron/handson-ml/master/"
HOUSING_PATH = "datasets/housing"
HOUSING_URL = DOWNLOAD_ROOT + HOUSING_PATH + "/housing.tgz"
def fetch_housing_data(housing_url=HOUSING_URL, housing_path=HOUSING_PATH):
    if not os.path.isdir(housing_path):
        os.makedirs(housing_path)
        tgz_path = os.path.join(housing_path, "housing.tgz")
    urllib.request.urlretrieve(housing_url, tgz_path)
    housing_tgz = tarfile.open(tgz_path)
    housing_tgz.extractall(path=housing_path)
    housing_tgz.close()
fetch_housing_data()

2、读入数据

通过panda库读取csv文件。

import pandas as pd
def load_housing_data(housing_path=HOUSING_PATH):
    csv_path = os.path.join(housing_path, "housing.csv")
    return pd.read_csv(csv_path)
housing = load_housing_data()