12,02,2018
|
dengwen168 |
安装:
pip install nltk
安装后打算用了,没相到出现如下的错误:
Resource 'corpora/gutenberg' not found. Please use the NLTK Downloader to obtain the resource: >>> nltk.download()
然后再执行以下代码:
import nltk
nltk.download()
会弹出一个界面,让你选择所需要安装的包,如果选择安装所有包的话,速度巨慢,所以还是要用哪个包就安装哪一个吧。
一、查看nltk有什么语料
...
12,02,2018
|
dengwen168 |
测试环境:
win7 ultimate(en)
Anaconda 3
一、安装Word2vec
Word2vec需要使用第三方gensim模块, gensim模块依赖numpy和scipy两个包,因此需要依次下载对应版本的numpy、scipy、gensim。
不过如果你使用Anaconda的话,前两个包已经安装好了,可能直接使用pip命令安装第三个包即可。
二、下载训练数据
下载地址如下:https://dumps.wikimedia.org/zhwiki/latest/zhwiki-latest-pages-articles.xml.bz2
三 ...
12,02,2018
|
dengwen168 |
一、HanLP开源分词系统
二、ansj分词
作者说arrays.dic是使用结巴分词的。
经过核实,ansj分词可能用的是新版的北大标注集。
《现代汉语语料库加工规范——词语切分与词性标注》词性标记
代码名称
帮助记忆的诠释
例子 及 注解
1
Ag
形语素
形容词性语素。形容词代码为a,语素代码g前面置以A。
绿色/n 似/d 锦/Ag ,
2
a
形容词
取英语形容词adjective的第1个字母
[重要/a 步伐/n]NP ,
...
12,02,2018
|
dengwen168 |
项目地址:
https://github.com/super-l/superl-url
运行环境:python 2.x
运行结果:
运行后会生成一个“关键字.txt”的文件,打开就可以看到:
不过好像不支持中文关键字?
12,02,2018
|
dengwen168 |
自己做的一个中文伪原创工具。
原稿:
中央政法委近日印发《关于学习宣传方金刚同志先进事迹的通知》,号召全国政法机关和全体政法干警,结合学习贯彻党的十九大精神和习近平新时代中国特色社会主义思想,结合推进“两学一做”学习教育常态化制度化,深入开展学习宣传方金刚同志先进事迹活动,在推进“四个全面”的征程中,不忘初心、牢记使命,奋力拼搏、开拓进取,为深入推进全面依法治国、建设更高水平的法 ...
10,02,2018
|
dengwen168 |
1、编码 隐匿在计算机软硬件背后的语言
这本书的原作者是享誉世界的顶级技术作家Charles Petzold,他曾于1994年被微软授予Windows Pioneer奖,以表彰他对Microsoft Windows的成功所做出的巨大贡献。(全世界只有7人获此殊荣,包括VB之父,Word之父等,但Charles Petzold是七人之中唯一的作家)这本书曾多次再版,豆瓣上有超过1600个点评,总评分为9.2,此外曾经推荐过这本书的名人包括(但不限于):刘未 ...
10,02,2018
|
dengwen168 |
当刘东华问“褚老,你希望留给自己的墓志铭是什么?”的时候,属兔的褚老缓慢而坚定地回答了五个字:褚时健,属牛。
他,传统企业的爆品王,造酒、制糖、产烟,种橙子,干什么都是最好的。他,影响企业家的企业家,他的故事和创业精神,深深影响了中国企业界包括柳传志、王石等一些大佬,以及无数要为明天而奋斗的年轻人。他,就是褚时健。
褚时健,这个曾被报告文学形容为像太阳一样灿烂的男人,淡然外表 ...
10,02,2018
|
dengwen168 |
可以将一个大的txt文件分割成N个txt文件,可以自己设定每个文件的行数,非常实用。
源码如下:
#coding:utf-8
#将大文本文件分割成多个小文本文件
import os
sourceFileName = "test.txt" #定义要分割的文件
def cutFile():
print u"正在读取文件..."
sourceFileData = open(sourceFileName,'r')
ListOfLine = sourceFileData.read().splitlines()#将读取的文 ...
10,02,2018
|
dengwen168 |
此方法是通过微信公众号文章接口来采集。
一、获取接口数据
进入微信公众号平台,然后执行:素材管理--新建图文素材功能,点击超链接图标。
通过查找文章的功能来搜索公众号
通过查看源码功能,可以看到这个公众号的fakeid。
还可以获取文章的接口地址:
最后附赠源码:
# -*- coding: utf-8 -*-
from selenium import webdriver
import time
import json
import requests
import re
import ...
09,02,2018
|
dengwen168 |
Updated on Aug-11-2019
今天再试了一下,发现自己的chrome安装路径变成“C:\Users\Kevin\AppData\Local\Google\Chrome\Application”这个了。
然后将安装路径改成这个,又报如下错误:
SyntaxError: (unicode error) 'unicodeescape' codec can't decode bytes in positio
n 2-3: truncated \UXXXXXXXX escape
将代码改成下面这样就可以了:
driver = webdriver.Chrome(executable_path='C:\\Users\\Ke ...
Page: 137 of 236 1 ...
135 136 137 138 139 ...
236