鄭碼
簡介
《鄭碼》簡稱《字根通用碼》,是我國著名文字學家、享譽海內外的《英華大詞典》主編鄭易里教授經半個世紀對漢字字形結構的研究,後期和鄭瓏高級工程師共同創造的重大科技成果。已獲中、美、英國專利授權,並通過國家級的鑑定。權威專家們確認《鄭碼》是國內最優秀的字形編碼系統。《鄭碼》規範、易學、快速、通用。用同一編碼規則不但可以輸入2萬漢字,還可以輸入68000個和10萬個漢字。《鄭碼》曾榮獲北京國際發明金獎和最優秀髮明大獎;榮獲第22屆日內瓦發明金獎。國家主管部門通過評比向國內外用戶廣泛推薦《鄭碼》。中國的中文之星等系統平台選用《鄭碼》,美國Microsoft公司的Windows95/98/NT/2000/XP中文系統選用《鄭碼》,美國IBM公司的OS/2和JAVAOS等許多中文產品也都選用《鄭碼》。
原理
《鄭碼》以單字輸入為基礎,詞語輸入為主導,用2-4個英文字母便能輸2字詞、多字詞和30個字以內的短語;在這種字詞交融輸入之下,輸入一個漢字的平均碼長是1.8-1.9鍵之間。他備有兩個詞庫,分別收錄25000和50000條詞語。《鄭碼》是一種繁體字輸入法,也是一種生僻字輸入法,當然它也是一種常規輸入法。鄭碼可以打出國標擴充字庫(原來叫GBK字庫,後來發展為GB18030字庫)里的2萬多個漢字,極大滿足了人們在日常生活、工作中使用漢字的需求。在常規情況下,《鄭碼》輸入法可以打出GBK字庫里的20902個漢字。比普通《五筆字型》能打出的6763個漢字要多打出14139個漢字。正因為這個原因Windows沒有預裝《五筆》,而是預裝了《鄭碼》輸入法。
基根位碼的確定
每一根區里都有幾個基根,它們的區碼都相同,在它們單獨成字或與其它基根組合成字時,會產生許多重碼字。為解決這一問題,《鄭碼》規定:第一主根的代碼用區碼的1個字母表示,第二主根和副根的代碼都要用「區碼+位碼」2個字母表示,即在區碼後面擴充一個位碼,這種安排使得每個基根都有了獨立的代碼,從而解決了重碼問題。就象每個人有姓有名才不會有太多的重名一樣。《鄭碼》的編碼規則第一條:要按照《鄭碼》的基本字根總表上所列出的基根(包括形近根),把漢字分解成基本字根才能編碼。如果沒有合適的基根,就要進一步分解成筆畫。例如:補--衤卜懇--艮心濾--氵虍心書--乛丨丶第二條:漢字分解後,基根和筆畫排列的順序叫做「根序」。根序的確定有三種情況:l.左右字、上下字以及由單筆畫組成的字,根序與規範的書寫順序一致(見上例中的「補、懇、濾、書」四個字的分解)2.具有相接、交叉和相嵌結構的字,第一筆先寫的基根或筆畫排列在前。例如:(【】方括號內是例字)相接結構的字:夭--丿大【沃笑】;疋--乛止【蛋疏】;交叉結構的字:束--木口【整辣】;夷--大弓【姨】;屯--七凵【純鈍噸】;相嵌結構的字:亘--二曰【桓恆】;僉--人二(橫三點)【檢驗】淵--氵(撇-豎)米;肅--肀(撇-豎)八【蕭簫】複合結構的字:決--冫乛大【缺炔】(又有相接又有相交);3.對於包圍字和包孕字,要將第一筆先寫的基根排在第一位。因為是以基根為單位排列根序。例如:困—囗木聞—門耳函—乛氺凵式—弋工載—車庫—廣車匭—匚車九趙—走乂但是,為了檢索的快捷和歸納的劃一,對於有「辶、廴」的字,確定根序時,要將「辶、廴」排列在第一位。例如:「達—辶大」、「延—廴丿止」。總之,給單字或詞語編碼,就是按照編碼規則依次取基根的代碼組成字詞的編碼。根序搞錯編碼也隨之而錯。因此,正確認識單字的根序十分重要。第三條:單字和詞語的編碼不能超過4個字母,因此要根據單字或詞語中基根數的多少決定基根代碼的取捨,這種取捨代碼的方法叫取碼方法(詳見以下說明)。單字的取碼方法術語:「1碼根」是指第一主根,因它的代碼只用區碼1個字母。「2碼根」是指第二主根和副根,因為它們的代碼要用區位碼的2個字母。「取1碼」的意思是只取該基根的區碼。一、單字編碼的取碼原則1.單字首根(即第一個基根)的代碼要按照實際碼數取,不能有所省略。就是說,首根是1碼根就取1碼;首根是2碼根就取2碼(區碼和位碼都要取)。2.為保證單字編碼不超過4個字母,首根之後的其餘基根代碼要根據不同情況決定取捨。一般是先舍位碼,只取區碼的1碼。例如:櫻--木F貝LO貝LO女ZM--FLLZ醒--酉FD曰K生MC--FDKM但是,對於四基根和多基根字,還要將中間一些基根的代碼全部捨棄,只取前兩碼和最末2個基根各1碼。就是說,取兩頭舍中間。例如:縮--糹Z宀WD(亻)一A白NK--ZWAN糖--米UF(廣)肀XB口J--UFXJ
相關事件
微軟的輸入法中,使用鄭碼輸入法10年之久,卻沒有支付任何費用。擁有該輸入法著作權的北京中易中標電子信息技術公司以美國微軟公司違法使用鄭碼輸入法、侵犯相關知識產權將微軟公司起訴。2009年11月18日,北京市一中院對此案作出了一審判決。法院認定微軟公司侵權成立,判令微軟公司停止生產和銷售涉及侵犯中易公司知識產權的操作系統。
鄭碼的歷史
如果要說世界上普及率最高的中文筆畫輸入法(字形碼),絕對不是五筆字型,而是鄭碼。 對大多數人來說,鄭碼是我們最熟悉同時又最陌生的輸入法。它是windows系統中唯一預裝的一套筆畫輸入法,除了鄭碼之外,其它的全拼雙拼、微軟拼音、智能ABC等都是拼音碼。然而我使用電腦這長時間,從未見過任何一個人會使用鄭碼的人。 從windows95開始,所有的中文windows系統(95/98/NT/2000/XP)都預裝了鄭碼。這到底是為什麼?鄭碼到底是誰發明的?為什麼微軟公司選擇的是鄭碼而不是五筆字型?鄭碼真的有什麼過人之處麼?
鄭碼到底是誰發明的?
鄭碼的發明人是我國著名文字學家、享譽海內外的《英華大詞典》主編鄭易里教授。我家裡正好就有他編著的這本詞典,1965年版,鉛字印刷的,現在已經老舊老舊的了。所以,對他的名字我覺得很親切。
鄭碼和五筆字型的淵源
鄭易里教授研究漢字拆分方案幾十年,1980年時候完成了世界上首個只用通用鍵盤的26個英文字母鍵將漢字代碼輸入計算機的《26鍵位漢字拆根輸入碼方案》。但是他將自己多年對字根、對漢字編碼理論和方案的研究心得和發明成果都無私地傳授給了王永民等人。王永民等人在鄭的研究基礎上完成了五筆字型的發明。可以說,如果不是他當時的無私奉獻,現在占中國統治地位的筆畫輸入法,就絕對不是五筆字型了。五筆誕生以後雖然獲得了很大的成功和榮譽,但鄭易里仍覺得五筆對於漢字的拆分不是很合理和完善,特別是不太符合漢字的文字規範,因此繼續不斷研究改進,在他的女兒鄭瓏的幫助下,最後共同發明了更為規範和完善的中文筆畫輸入法---《字根通用碼》。也就是我們後來看到的鄭碼。
鄭碼的過人之處
《鄭碼》以單字輸入為基礎,詞語輸入為主導,用2-4個英文字母便能輸2字詞、多字詞和30個字以內的短語;在這種字詞交融輸入之下,輸入一個漢字的平均碼長是1.8-1.9鍵之間。他備有兩個詞庫,分別收錄25000和50000條詞語。為了不同用戶的需求,鄭碼輸入法分為《普及型》和《標準型》兩種。《標準型》重碼率低,適合高速盲打輸入。 《鄭碼》的優勢是,在漢字文字規律方面符合國家語言文字規範,具有規範、易學、快速、通用的特點(當然,這個易學和快速,是相對於當時的筆畫輸入法而言的),有條件在中、小學和社會上推廣應用。鄭碼因此獲得了國家無數的獎項和榮譽。(現在看來,目前中文錄入速度最快的應該是五筆字型,已經超過每分鐘300個字。而鄭碼的最高速度大約是240字。而最簡單易學的輸入法,我想還是拼音吧:D) 但是,鄭碼具備有其它輸入法無法替代的一個重要優勢:在不改變編碼規則和字根代碼的前提下,可以方便地給10萬漢字編碼。也就是說,學會用《鄭碼》輸入幾千個常用漢字,用同一方法編碼,還可以輸入幾萬個中國的生僻漢字以及日本和韓國的漢字。有了鄭碼,我們可以輕易的完成中日韓三國的漢字錄入工作,可以完成《說文解字》乃至《漢字典》這樣超大字符集漢字的錄入,這一優勢是其他輸入法所不可比擬的。 1994 年末,三星公司受韓國go-vern-ment委託,來中國大陸引進漢字輸入法,以完成韓國訓民中文系統和將超過5000萬漢字的珍貴國寶《高麗大藏經》(其實這個大藏經也是高麗王朝在北宋年間從中國引入的)電子化的工作,中文信息學會向韓國推薦了十幾種輸入法。不久三星公司派來三位專家。在中文信息學會的配合下,馬不停蹄地將這十幾個「碼」輪番考核、測試、篩選。經過嚴格測試和考核,公司高層領導最後決定,原來準備選三種「碼」(輸入法)的打算,現在決定只選一種就可以了,那就是鄭碼。韓國三星集團的理事長總結時候說:「《鄭碼》是1995年三星最成功的技術引進。」
鄭碼和windows的淵源
《鄭碼》經過一系列國家級的測試、鑑定、評審,都認為具有世界領先水平之後。這個經過千錘百鍊的漢字編碼系統可以定型推廣了。鄭易里建議接過他的接力棒的中易公司又瞄準了新的目標——曲線漢字庫。因為,這是除了我們無力問津的操作系統以外的中文信息處理的另一個關鍵因素。 漢字庫是中文信息處理的最終表現,因為大家看見的不是輸入法,也不是操作系統;而是用精美的漢字打印出來的文章。電腦用漢字庫的初級階段是由各個「點」組成的漢字字形。稱為用「點」來描述漢字。它不能無級放大、縮小,要像鉛字一樣大小分號,而且略大一些的點陣字、筆劃邊就像鋸齒一樣難看。當時通用的排版系統上的漢字庫是中等技術級的矢量漢字庫。即是用直線來描述漢字字形,直線部分自不必說,而曲線部分,是用許多折線來組成。這種漢字庫,稍一放大,就會由於顯出曲線部分的折線來,產生變形而無法使用。當中易公司要進入漢字庫開發領域時,決心越過矢量漢字庫,迎頭趕上世界最先進的用曲線描敘漢字字型庫的技術。當時世界上只有美國 2—3 個公司有這種用曲線描敘西文的技術,而用曲線描述漢字要比西文龐大複雜的多。公司利用世界上已公開的曲線描述字形的很少資料,組織軟件工程師們向曲線字庫的縱深領域進攻,同時聘請國內最權威的字模專家做字形的技術總監,並和中國標準技術開發公司專門開發國家標準點陣字庫部門合作,一場向世界最高水平,符合國際曲線標準漢字字模的戰役全面展開! 做曲線漢字字模是一件周期長、技術水平很高、風險大、資金投入大的項目。中易公司已連續創業4年,基本上都在完善《鄭碼》而沒有什麼收入。當為尋求開發曲線漢字庫的資金,向一些大電腦公司尋求合作時,他們卻認為符合國際標準的 20902 個漢字的曲線漢字庫的應用時機還很遙遠。現在就投入大量資金開發風險太大,怕得不償失,於是都婉言謝絕。 但是中易公司認為,在信息時代,技術的更新,不是逐步到來的,而是像三級跳跳來的。我們是中國人,不但要在漢字輸入法方面世界領先,在漢字庫的技術領域,也要領先,才不愧對發明漢字頗講書法藝術的老祖宗! 事情果然像預料的那樣,1994 年初,世界最大的美國微軟公司把剛剛誕生才幾個月的 Windows3.2 中文版就準備拋開,全力開發 32 位操作系統的 Windows 95 中文版。包括中、日、韓三國的 20902 個漢字的國際標準。美國微軟的工程師很快來北京調查,誰家有這 20902 個國際標準的漢字庫?哪個輸入法能支持(檢索)這 20902 個漢字?他們馬上找到了中易公司,他們在了解《鄭碼》能不能支持(檢索)20902個國際標準漢字時,中易公司給他們演示的卻是當時世界最大的國家6萬電腦大漢字庫的輸入(檢索)。他們看到《鄭碼》只用4鍵就能迅速準確地輸入 6 萬漢字時,驚訝之極,難以言表。即然6萬字都這麼幹淨、利索地輸入,20902 個漢字還在話下嗎。再問到誰家有這 20902 個曲線漢字庫時,中易公司輕鬆地將打印好的全套樣本展現在他們眼前。以後的半個月,他們曾4次派不同級別的工程師和管理專家來中易公司諮詢考查,確認一切完備無誤後,要了樣品才滿意離去。 從這以後,隨着Windows中文版的推廣,《鄭碼》和中易字庫一起進入了千萬中文用戶的電腦中。