日文文書処理

語彙表(ごいひょう)の作成(さくせい)

日本語(にほんご)の語彙表(ごいひょう)を作成(さくせい)しよう。ここでは、主(おも)に表計算(ひょうけいさん)ソフトを使(つか)って、

  1. 日本語能力試験(にほんごのうりょくしけん)1〜4級(きゅう)の出題基準(しゅつだいきじゅん)に含(ふく)まれる語彙(ごい)
  2. 日本語能力試験(にほんごのうりょくしけん)の出題基準(しゅつだいきじゅん)には含(ふく)まれないが、新聞(しんぶん)やニュースなどによく現(あらわ)れる語彙(ごい)

の2種類(しゅるい)を作成(さくせい)する。

語彙表(ごいひょう)とは?

語(ご)のまとまりを語彙(ごい)という。語彙(ごい)の一覧表(いちらんひょう)を語彙表(ごいひょう)という。語彙表(ごいひょう)には、語(ご)そのものだけでなく、語(ご)の意味(いみ)や発音(はつおん)(読(よ)み方(かた))など語(ご)に関(かん)する情報(じょうほう)も示(しめ)されるのが普通(ふつう)である。

語彙表(ごいひょう)の例(れい)として、日本(にほん)の国語教科書(こくごきょうかしょ)(小学校(しょうがっこう))と日本語教科書(にほんごきょうかしょ)(初級(しょきゅう))の語彙(ごい)を比較(ひかく)する研究(けんきゅう)で作成(さくせい)したものを挙(あ)げておく【→日本語教科書語彙表(TSV形式・Stuffit圧縮ファイル;92KB)】。

表計算(ひょうけいさん)ソフトとは?

語彙表(ごいひょう)のようなデータは、表計算(ひょうけいさん)ソフトを使(つか)って作成(さくせい)すると便利(べんり)である。

数値(すうち)などのデータを集計(しゅうけい)・解析(かいせき)するためのアプリケーションソフトウェアapplication softwareが表計算(スプレッドシート)ソフトspread sheet softwareである。旧(きゅう)Lotus Development社(しゃ)(IBM社(しゃ)に買収(ばいしゅう)され、現在(げんざい)はLotus Software)の「Lotus1-2-3(ロータス ワンツースリー)」や米(べい)Microsoft社(しゃ)のMicrosoft Excel(マイクロソフト エクセル)などが、代表的(だいひょうてき)な表計算(ひょうけいさん)ソフトである。

一般的な表計算(ひょうけいさん)ソフトは、数値(すうち)だけでなくテキストも扱(あつか)うことができるので、多(おお)くのテキストデータを集計(しゅうけい)するときにも表計算(ひょうけいさん)ソフトを使(つか)うと便利(べんり)である。

表計算(ひょうけいさん)ソフトで作成(さくせい)されたデータは、そのままでは異(こと)なるアプリケーションソフトで利用(りよう)できない(ことがある)。そのため、データの交換(こうかん)や配布(はいふ)には汎用性(はんようせい)の高(たか)いTSVやCSVが使(つか)われる。

TSVとCSV

「TSV」とは、タブ区切(くぎ)りのデータTab Separated Values、「CSV」とはカンマ区切(くぎ)りのデータComma Separated Valuesという意味(いみ)である。

実際(じっさい)のTSVは、データをタブtabで区切(くぎ)って表わしたテキストファイルtext fileであり、CSVは、データをカンマcommaで区切(くぎ)ったテキストファイルである。どちらもテキストファイルであるため、テキストエディタtext editorなどで直接(ちょくせつ)編集(へんしゅう)することができる。

表計算(ひょうけいさん)ソフトで扱(あつか)うデータについて、項目(こうもく)の値(あたい)と値(あたい)との間(あいだ)にタブを入(い)れればTSVになり、コンマを入(い)れればCSVになる。また、データの行(ぎょう)は改行(かいぎょう)によって示(しめ)せばよい。以下(いか)の3つのデータは、すべて同(おな)じ意味(いみ)を表(あらわ)すものである。

《TSV》
127  36  3
132  38  3
144  38  3
117  37  7
186  45  5
  96  34  9
162  42  6
《CSV》
127,36,3
132,38,3
144,38,3
117,37,7
186,45,5
96,34,9
162,42,6
《表計算ソフトでの表示例》

語彙表(ごいひょう)の作成(さくせい)

表計算(ひょうけいさん)ソフトでは、行(ぎょう)と列(れつ)とによってデータが系列化(けいれつか)される。このとき、データの数(かず)の多(おお)いものを同(おな)じ列(れつ)にまとめるのが普通(ふつう)である。たとえば、100人(にん)の学生(がくせい)の英語(えいご)と中国語(ちゅうごくご)のテスト成績(せいせき)を入力(にゅうりょく)する場合(ばあい)は、次(つぎ)のようになるだろう。

《入力例》
データ数の多い項目については、データが縦方向に続く(同じ列に並ぶ)ようにするのが一般的。

日本語能力試験(にほんごのうりょくしけん)の出題基準(しゅつだいきじゅん)に含(ふく)まれる語(ご)を表計算(ひょうけいさん)ソフトに入力(にゅうりょく)しよう。また、それぞれの語(ご)の発音(はつおん)、アクセント、中国語訳(ちゅうごくごやく)、レベルもあわせて入力(にゅうりょく)しよう。

《入力例》

『発音(はつおん)』は、ひらがなで読(よ)みを、『アクセント』は、下(さ)がる部分(ぶぶん)の拍(はく)の番号(ばんごう)を数字(すうじ)で示(しめ)してみよう(辞書(じしょ)に載(の)っているものをそのまま書(か)けば良(よ)い)。また、『レベル』は日本語能力試験(にほんごのうりょくしけん)の何級(なんきゅう)かを数字(すうじ)で示(しめ)そう。

アクセント表記(ひょうき)の方法(ほうほう)

日本語(にほんご)のアクセントは、高低(こうてい)の2段階(だんかい)である。また、日本語(にほんご)の語(ご)では、[高(こう)]から[低(てい)]に下(さ)がる部分(ぶぶん)は、必(かなら)ず1カ所(かしょ)以下(いか)(0または1)しかない。そのため、日本語(にほんご)アクセントの表記(ひょうき)では、下(さ)がる部分(ぶぶん)の拍(はく)の番号(ばんごう)を数字(すうじ)で示(しめ)すのが便利(べんり)である。

東京式のアクセントは、下がる場所が分かれば識別できるので、下がる部分の直前の拍が先頭から数えて何番目か数字で示せば良い。

なお、促音(そくおん)の「ッ」、撥音(はつおん)の「ン」、長音(ちょうおん)の「ー」、拗音(ようおん)を含(ふく)む「キャ」「キュ」「キョ」など、外来語(がいらいご)の「ファ」「フィ」「フェ」「フォ」「ティ」「ヴァ」などはすべて1拍(いっぱく)に数(かぞ)える。

新聞(しんぶん)などに出(で)ている語(ご)で、日本語能力試験(にほんごのうりょくしけん)の出題基準(しゅつだいきじゅん)に含(ふく)まれないものを見(み)つけて、表計算(ひょうけいさん)ソフトに入力(にゅうりょく)しよう(人名(じんめい)や地名(ちめい)などの固有名詞(こゆうめいし)は除(のぞ)く)。また、それぞれの語(ご)の発音(はつおん)、アクセント、中国語訳(ちゅうごくごやく)、出典(しゅってん)もあわせて入力(にゅうりょく)しよう。

《入力例》
注意:文字化けしないためには

日本語(にほんご)と中国語(ちゅうごくご)の両方(りょうほう)が含(ふく)まれるデータは、UnicodeのTSV(またはCSV)で保存(ほぞん)する必要(ひつよう)がある。

Microsoft Excel(中文版)の場合(ばあい)は、次(つぎ)のようにする(UnicodeのTSVで保存(ほぞん)される)。

  1. 「檔案」メニューから「另存新檔」を選ぶ。
  2. 保存用のパネルの下の方にある「檔案類型」で『Unicode文字』を選ぶ。
  3. 「儲存」ボタンを押して保存する。
ページの先頭へ↑
←ひとつ前に戻る
目次へ
トップページへ