2009年4月7日 星期二

蠟燭兩頭燒

最近真的很忙,除了reason extraction文章的label,blog post的實驗,還有kdd cup的資料要處理,弄得有點頭暈,昨天弄完實驗的資料傳給老師後,今天一大早差點睡過頭...所幸走路速度很快,沒有遲到 哈

今天先跑完維度資料後,要早點回去睡,明天再專心處理,不然,我想我的腦袋會亂糟糟

2009年3月20日 星期五

PHP

雖然說PHP也用了兩年,大學也有在自己學,不過感覺還是不精通阿
就像其他的程式語言一樣,雖然幾乎都自己學過,但是樣樣通,卻是樣樣不精
頂多是有一般人寫的水準,無法更進一步。

很想要再多學點程式及系統的規劃,像是模組的流程,設計,在PHP中稱為MVC(modal,viewer,controller)
這類的規劃,我覺得對於目前論文的系統很重要,主要在於程式的設計,不要過於繁複,盡量簡化,模組物件化,可以使得系統提高效率,所以呢,上次哲民推薦的人月神話這本我想買來參考,對於現在或是以後,應該能讓我的能力更上一層樓,再來程式和論文還要再多加強,撰寫論文時,每每下筆都覺得字句不通,需要不斷修改,英文也要再加強,能力還是不夠阿啊阿啊...唉

2009年3月17日 星期二

系統建構

流程真的挺重要,依照當初設計好的流程,一步一步建構,就像蓋房子一樣,總是要有張藍圖照著走,現在phase 1的部分大概都完成了,介面也稍微設計了一下,看起來比較正常了,有趣的是,每次再把不同component合併時,總是會有一些問題,當昨天把介面和程式串起來的時候,又出現一堆詭異的小蟲,花了一個下午才解決,不過整體上都還OK,真慶幸我寫的程式彈性很大,不管怎樣改都可以,哈

另外擷取網頁也找到可以使用的工具,其實這個工具在之前就用過,只是當初沒發現他可以採用multi的方式擷取網頁,昨天稍微測了一下,100個網頁約十秒,快則六秒,慢則十一,這比當初快了五十倍左右阿,真是不錯呢,今天要試試看五百到一千個網頁會多久,如果可以的話就會加到phase 1

2009年3月9日 星期一

當一件事情做久了會有種錯覺

那就是會覺得自己瞭解的很深入,實則不然
每次在寫程式的時候,或者看書、看電影,內容可能是重複,但是每次看都會有不同的感受

今天在改程式的時候,又開始這種感覺,可能是改的不順還是怎樣,雖然大致上multi-word query和query extension都做好了,想想還是有些小問題,不過大體上都不影響,結果可能會有些許誤差

後來又在想multi-thread該怎樣處理,一晃神,突然想到其實也不用特意改到linux才行,在windows下呼叫用其他能處理的程式應該也可以,不過現在還處於測試的階段,如果可以的話,那就方便多了,可以省去不少麻煩阿 ha

2009年2月25日 星期三

好想睡覺

為了處理系統移到linux,弄了一個禮拜,幾乎沒什麼睡,因為以前也很少在用linux,用起來很不順手,主要問題還是程式執行會發生錯誤,還有pcntl一直找不到怎樣安裝,雖然說是php內建模組,但是不管是內建的PHP或者自行安裝的版本,兩者都沒有這個模組,真是活見鬼...

另外論文的修改還算順利,畢竟這個領域的文獻閱讀還算足夠,從碩一上就開始接觸,到目前為止背景知識建立算是基礎都有了,只是在撰寫有待加強,所以我現在都有在練習寫文獻摘要,或者是寫下對每天做事情的心得,只是不一定會寫在部落格就是了

這學期有兩門老師的課,有空的話比較想要聽Data Mining,畢竟沒有修過,覺得這方面的背景知識還是不夠。

呼,今天要早點睡,現在在寫這篇時,我的眼睛快要閉上了...

2009年2月17日 星期二

關於字典擴充

因為在background的部分需要不斷增加情緒字典的詞彙,找到一篇還蠻有幫助的論文:combining local and global resources for constructing an error-minimized opinion word dictionary,出自PRICAI 2008,這篇論文中提到一個蠻重要的論點,當我們不斷增加情緒字典的seed word,會產生錯誤判斷,將字放到不正確的屬性,比方fake會被放到positive的部分,但其實fake應該是屬於negative,這篇論文提出的方法目前看起來是有效的解決這個問題,等看完這篇論文後,在和實驗室的同學分享。

2009年2月12日 星期四

系統修改

目前算是告一段落了。

online版本因為採用登凱學長的論文其中一個方法,實做比較快,現在已經和原本系統銜接上,不過其準確率還有帶加強,會用學長的方法主要原因是快,減少原系統的處理時間,固定的情緒字典比起將每個字丟到Altavista查詢快多了,為什麼呢?比方說現在一篇文章有十萬個字,一旦使用altavista查詢並且回傳值,等待時間非常久,就算一個字一秒,也要十萬秒才能完成每個字的權重計算,但是情緒字典不同,在online的系統中,不必等待過多的時間,啪一下就可以完成,多麼令人感動阿。

不過另外一個麻煩是系統移植到unix-like的平台,檔案權限和library的處理始終讓我一個頭兩個大,查了很久,還是沒有找到解決方式,我想最近寄個信件給許富浩老師,畢竟張老師對這個比較熟悉,我自己還是不熟。

希望能夠盡快完成論文,唉,感覺我的寫作仍然有待加強,思路不通,表達不明。

2008年12月16日 星期二

凡事急不得

今天在幫傑程學長看論文,做互評的報告,當初在五月的時候也曾有做過一次,不過當時是碩一的時候,時隔半年又再做一次,感覺不太一樣,因為這段時間看了不少論文,自己也有做了類似的實驗,現在在看的時候比較有感覺,能夠瞭解說為什麼要做、該怎樣做...。個人的感覺閱讀論文的量和素質對自己本身的提升有一定的助益,因為閱讀的量與質夠的話,當在閱讀論文的時候,比較能夠反應說這篇論文的想法、做法以及貢獻等。

早上在和老師討論坤彰的論文的部分,因為碩一上的時候已經有實做過,現在要跑四個query,不過呢,反事真的不能急躁,因為我想趕快把結果跑出來,四個query一次跑,結果呢,因為實驗方法有一個步驟要計算每個字屬於positive以及negative,計算權重,要將每個字丟到altavista的網站,但是一次跑四個query,又一次這麼大量的字丟過去,所以現在被鎖IP,沒辦法使用。只能等明天看網頁能不能進去,唉,真的不能急呢。

不過學長的論文有點久沒看了,今天討論的時候還有點忘記。像是在query的部分,因為之前都是以一個word作為query,不過當我們以一個較長的句子或者比較多個單字作為組合的時候,該怎樣去找到計算LODR or PMI的topic word,因為topic word對於計算的影響很大,與老師討論的結果是將query中的stop word刪除,剩餘的字作為topic word。

2008年12月10日 星期三

接下來的進度

1.整理每篇論文的方法
2.修改論文
3.實驗的方法修改

加油加油加油!!!!

2008年11月19日 星期三

最近的研究以及目標

最近做的blog content extraction的實驗做出來的效果似乎沒有比較好,而從上禮拜看了一些相關web page content extraction的論文中提到的方式似乎有些不太一樣,比較起來,感覺好像是我們的feature取的比較少,相對的辯析的程度會稍微低一點。

這是一點對於最近做的東西的感想,數據的處理上還需要多想一些,比方說怎樣比較,比較的基準等等。流程的表現、數據的表現,這些都是需要再三思考,不過覺得自己也有點進步,而不是一味的去做,在做之前需要先想清楚為什麼做?怎樣做?怎樣提高效率?這些都是很重要的事情。

另外就是英文也是很重要的,這半年來,每天早上都會唸英文,練聽力,在閱讀論文上的速度比以前快很多,真的幫助不少,一方面可以增加自己的能力,比方說對於英文的語感增加,閱讀論文的速度也跟著增加,文章也更容易理解,當然也不是百分之百懂,不過呢,至少都比以前好很多了,感覺很棒。

當然,在把自己做的這些東西寫成論文後,可以更加瞭解自己在做什麼,在文字上的編排以及修飾,實驗的內容以及調整,相關研究等等,在整理過後,更有條理的寫出來,實驗的數據整理我覺得是比較重要的一件事情,整理的越詳細,在往後撰寫論文上有很大的幫助,這也是我覺得自己之前沒有做好的地方。

希望往後能夠改進,當然論文的方向還是一個比較困擾的地方。雖然說看了不少的論文,也有一些想法,不過總覺得還是缺乏什麼,恩,總而言之,就是加油!

2008年7月2日 星期三

最近閱讀論文的心得

上次與老師meeting後,看了一些相關的論文,也就是對於imbalance data的相關研究。

針對網頁的內容,想要擷取POST的內容,但是一個網頁中總是有許多不需要的資訊在裡面,該怎樣取出來,這也是和imbalance data有關的部分。其實在看了這些論文後,發現在現實生活中還蠻多實際例子,比方說詐欺案件、海面上的浮油等等,諸如此類的事件都和imbalance data有關。

這讓我想到看過的美國影集,這部影集是在講如何透過數學建立的model,幫助警察抓到兇嫌。映象最深刻的是有一集因為兇手已經跑走,數學家透過分析,建立一個針對兇手的習慣和行走模式的model,透過這個model猜測目前兇手所在位置可能在哪。這讓我覺得數學真的很了不起,也很強大,以前在學校學數學的時候,總是想說以後用不到,看了這個影集讓我改觀,

扯遠了,最近看論文的時候覺得之前看的時候還真是偷懶,不太喜歡看reference,下場就是有的時候會一知半解,這次把reference的PAPER都找出來看,雖然真的很多(超級多呢,有兩三篇都是30頁以上),不過越看越有趣,只是看的有點累就是了。

2008年5月20日 星期二

meeting後心得

昨日參加老師、登凱學長的meeting,主要是對於國科會報告的修正。

該怎麼說呢,我想,對於論文該怎樣去撰寫,報告該怎樣表示,昨日的meeting感覺有點收穫。
因為對於報告而言,可能還是像大學那樣,對於不是很懂得地方,囫圇吞棗,簡單的帶過,或者文章會看的不夠仔細,想的不夠多,這些地方都是很大的改進空間,亦或者未來在撰寫論文時可以作為警惕。

也希望同學能夠一起注意這些地方。

2007年12月24日 星期一

最近的上課和工作的感想

這一個多月來,從老師交代的工作中學到了不少東西,也從paper中學到了很多東西,雖然說其中也遇到很多問題,比方說paper的conference找的不夠好,研讀的不夠仔細,網頁撰寫的時候遇到的問題目前為止都在可以解決的範圍中,也從網路上找到許多技術可以是用(或許稱為技巧比較好!)。

截至目前為止,網頁的工作也快要到一個段落,現在遇到比較大的問題是整合的時候發生一件很奇怪的事,處理setiment的時候,一直會發生timeout,也發生被AltaVista檔掉的事情,因此,我想把這個部分切成幾個小部分去做,將term分成幾個小部分去跑,看會不會比較好,目前卡在這邊已經很久了,因為跑一次就要四五個小時,結果等到跑完卻出現timeout的訊息,真是令人頭大。這個部分可能還要和學長討論一下,在和老師報告。

不過接下來很多功課要處理,不曉得是不是能夠順利完成,希望能夠盡快完成這一部份,讓網頁能夠進早完成。

2007年11月8日 星期四

本日進度

目前已經把pre-processing的部分做完, irrelevent blog filtering的部分也做的差不多了,
接下來要進到比較麻煩的部分:reason extraction,這邊我想要採用的方法是LODR,去計算include reason的強度,不過在計算上可能會比較麻煩,要記錄的東西也相當多,希望能夠順利寫完.

2007年10月21日 星期日

效能問題..

目前坤璋程式進度還算OK
不過有一個地方效能不是很好
就是一開始擷取網頁的部分

雖然說在坤璋的程式裡也是要跑很久,
不過php也是一樣,目前找了一些io的方法來看
不曉得能不能找到加速io的方法.

2007年10月13日 星期六

目前進度...

星期四meeting後,我有檢討一下
基本上坤璋的論文就如同老師講的,是我自己沒看懂,所以我連抓出來show在網頁上的檔案都不清楚是什麼

再來是程式的部分
老師說的地方大概都知道怎樣去加強
不過因為程式是用BCB所寫的
很多套件的地方要重寫,改起來也會相對的麻煩很多,不會比較快
這個部分可能要和老師溝通了
因為我也很苦惱,要改的話,時間上會不夠,用PHP改的話,因為有些地方可以直接改用套件部分
相對會比較快讓系統run起來
大致上應該這上次meeting之後的想法

2007年10月7日 星期日

Tags消除

因為所有的檔案都是從網頁上分析之後取出
現在因為要將資料output在browser中
透過php函式strip_tags可以將取出的段落中包含html以及php標籤都移除
且標籤若是非法,會在browser顯示.

另外,剛剛發現在三維陣列表示中
我把維度搞錯了 ...
結果印出的資料回圈跑太多次,速度也很慢
剛剛改好之後速度就快多了.

Regular expression(2)

這篇是對regular expression的解釋

$patterns = array("/((1920)\d{2})-(\d{1,2})-(\d{1,2})/", "/^\s*{(\w+)}\s*=/");

$replace = array("\\3/\\4/\\1", "$\\1=");print preg_replace($patterns, $replace, "{startDate} = 1969-6-19");

1./ 和 / 所夾的部分代表要比對的 pattern
2.^ 代表從字串開頭\s 代表 [\r\n\t\f\v] 換行、跳行、空白字串..

3.代表 0 or 1 or any\w 代表 [a-zA-Z0-9_]+ 代表 1 or any\d 代表 0-9 的數字
所以 " {startDate} =" 亦符合 /^\s*{(\w+)}\s*=/
4.((1920)\d{2}) 代表會搜尋 19 或 20 開頭、並且其後接有兩位數字的 pattern
像是: 1983、2006。

5.\d{2}代表數字需重複兩次,換個角度來說,可看成要尋找兩位數。

\d{1,2}則是至少出現一次、至多出現兩次,如:1、31、99..

6.\\3/\\4/\\1則表示將符合的模式的結果,取代為第三個set/第四個set/第一個set

\\1 表示符合 ((1920)\d{2}) \\2 表示符合 (1920) \\3 表示符合 (\d{1,2}) \\4 表示符合 (\d{1,2})
就本例而言: 1969-6-19 變成 6/19/1969

這篇範例可以讓我門了解到如何在php上表達以及使用regular expression和preg_replace

Regular exepression

對於分析文字檔中含有網頁tag,現在想到的是利用preg_replace()將所有的html標籤刪除

下面兩個網頁是針對這個function所有功能的表示
http://tw.php.net/manual/en/ref.pcre.php
http://tw.php.net/manual/en/ref.regex.php

這個function蠻好用的
希望今天能把這部分弄完.
接下來就可以改快來弄美工的部分...

2007年9月30日 星期日

php呼叫外部程式

星期五找到現在,大概找到三種方式可以call外部的程式執行,
不過都有一些奇怪的地方,不符合我想的方式...

網上查的有三種,exec(),system(),shell_exec(),
比方說我想要執行一個mp3的檔案,可以用這些function呼叫,不過都沒有開啟成功,
查了說是safe_mode和檔案權限的關係,不過我看了一下,設定是OK的.

真懷疑是那邊出問題,明天還要去圖書館查資料,晚上再把坤璋說的流程自己跑一次
這樣才不會搞混.