2019年5月4日土曜日

KHコーダ(KHcoder)でテキストマイニング  ~ 共起ネットワーク その2 ~


今回、題材としたのはシャーロックホームズの「赤毛連盟」。
有名な話なので読んだことがある人も多いだろう。
もし読んだことが無かったり、若しくは内容をよく覚えていない方は青空文庫等で入手できるので一読して欲しい。その方がテキストマイニングの結果が分かりやすいと思う。
日本語作品は「青空文庫」で、英文は「プロジェクトグーテンベルク」というサイトで入手可能。


早速KHコーダ(KHcoder)を起動して日本語テキストを取り込む。
上部メニューの「プロジェクト」から「新規」、それから当該テキストを選択して新規プロジェクトを作成して、「前処理」→「テキストのチェック」を行う。今回は修正の必要は無いようなので、そのまま「前処理の実行」を行った。
それから抽出語リストを開いて確認し、それから共起ネットワークを作成した。


図1.最初の共起ネットワーク画面

共起ネットワークを確認したところ、今回のテキストでは「シャー」と「ロック」がそれぞれ別々の語で抽出されていた。そのため一度共起ネットワークを終了させ、「前処理」→「複合語の抽出」で行い、それから「前処理」→「語の取捨選択」で「シャーロック」を「強制抽出する語の指定:」で設定した後、「前処理の実行」を行い再度共起ネットワークを描画させた。

以後、オプション画面での設定は下記の通り。
「集計単位」を「段落」
「最少出現数」は10に設定
「品詞による語の取捨選択」では「既定値」
「共起関係(edge)の種類」では「語-語」
「バブルスロット」にチェック
「共起パターンの変化を探る(相関)」にチェック

条件を変えて検討する場合は「実行時にこの画面を閉じない」にチェックを入れる。


まず「Subgraph」を表示させる。


図2.Subgraph - modularity


図3.Subgraph - random walk

サブグラフ検出では「modularity」と「random walk」で、それぞれグループ分け(subgraph)の細部が違っているが、この subgraph により大まかな物語のあらすじは分かってくる。


次に「中心性」を見てみる。
図4.共起ネットワーク「中心性」

中心性で見ると、「質屋」「銀行」「店員」「髪」「コバーグ」※ などの言葉があり、この物語のキーワードとなることがわかる。
※「コバーグ」は質屋がある場所名、すぐ隣に銀行がある。


図5.共起ネットワーク「中心性」(最少スパニング・ツリーだけを描画)

「最少スパニング・ツリーだけを描画」にチェックを入れて描画した。こちらの方がキーワードが分かりやすい感じがする。


最後に「相関」を見てみる。


図6.共起ネットワーク「相関」

こちらも最少スパニング・ツリーだけを描画させた。

図7.共起ネットワーク「相関」(最少スパニング・ツリーだけを描画)

「相関」を表示させることにより、物語の前半では「ウィルソン」「髪」「連盟」などの言葉が、後半では「地下」「銀行」「質屋」などの言葉が多く用いられるようになっていることが分かる。これで物語の展開が大まかに理解できるだろう。
こちらも「最少スパニング・ツリーだけを描画」にした方が分かりやすいようだ。

次に、「関連語検索」で共起ネットワークを表示させてみる。
とりあえず「赤毛」で検索する。
「ツール」→「抽出語」→「関連語検索」で「関連語検索」の画面を表示させて「#直接入力」で「直接入力:」と「and」ボタンの横の入力エリア(デフォルトのカーソルの位置)に「赤毛」と入力し、集計単位は「段落」として「集計」ボタンを押して検索させた。
「フィルタ設定」で品詞は「既定値」、「最少文書数」は10で設定で「OK」を押して、「共起ネット」ボタンを押して描画さる。
「赤毛」を中心とした共起ネットワークが表示された(検索語は二重正方形で囲んで表示)。


図8.「赤毛」で検索した共起ネットワーク

最少スパニング・ツリーだけで描画させた。

図9.「赤毛」で検索した共起ネットワーク(最少スパニング・ツリーだけを描画)

こちらは検索語の選択も含めて、もう少し条件を検討した方が良さそうである。


続いて英文に関しても同様に行う。
抽出語の確認をしたところ、英文では「sherlock」は問題無く認識されていたので、強制抽出は行わなかった(stop words は設定済み)。
「品詞による語の取捨選択」では「すべて」を選択。後は日本語と同じ条件設定で行った。

図10.共起ネットワーク「Subgraph modularity」表示


図11.共起ネットワーク「中心性」表示


図12.共起ネットワーク「中心性」表示(最少スパニング・ツリーだけを描画)


図13.共起ネットワーク「相関」表示


図14.共起ネットワーク「相関」表示(最少スパニング・ツリーだけを描画)


同じく気になるキーワードがあれば、日本語と同様に「関連語検索」で共起ネットワークを表示させれば良い。
例として「red-headed」で検索して、共起ネットワークを最少スパニング・ツリーだけで描画させた(Subgraph - modularity表示)。



今回は共起ネットワークだけを用いてテキストマイニングを行ったが、以上のように題材とした小説「シャーロックホームズの冒険・赤毛連盟」の大まかなストーリーやキーワードは英語・日本語共に理解できた。KHコーダには共起ネットワーク以外にも様々なコマンドがあるので興味がある方はマニュアル等を参考にしていただきたい。さらに詳細なテキストマイニングを行えるはずである。

2019年5月2日木曜日

KHコーダ(KHcoder)でテキストマイニング  ~ 共起ネットワーク その1 ~


KHコーダにはいくつかの分析コマンドがあるが、今回は主に共起ネットワークを使用することにした。共起とは、ある単語と別の限られた単語が頻繁に出現することである。
このコマンドを用いることにより出現パターンの似通った語を線(edge)で結んだネットワークを描画することが出来る。そこからテーマないしはトピックを読み取れる。
よって小説でこの分析コマンドを使うと、物語のあらすじや登場人物の関係図などが読み取れるはずである。


共起ネットワークを表示させるには大きく分けて二つある。

その1.「ツール」→「抽出語」→「共起ネットワーク」で起動する方法
これで起動すると共起ネットワークの「オプション」画面(設定画面)になる。ここで各種の設定を行い「OK」で共起ネットワークが描画される。
それぞれの設定に関しては基本的はデフォルトの設定で大きな問題は無いが下記項目に関しては検討が必要となる場合もあると思う。

<集計単位と抽出語の選択>
「集計単位」
KHコーダでは分析対象テキスト中で「語」が出現する場所と「語」が出現する回数を計算して分析する。「語」は抽出語のことで分析の最小単位となり、「場所」は「文」または「段落」のことである。よって集計単位を「段落」に設定するのか「文」に設定するのかで結果が大きく異なることがある。「段落」「文」それぞれを試して良い方を選択する必要があるが、「段落」→「文」の順で評価することが推奨されている。

「最小出現数」
出現語(抽出語)の最少出現数を設定する。大きくすれば対象語が少なくなるし、小さく設定すれば多くなる。試して最も適当な数値を検討する必要がある。

「品詞による語の取捨選択」
前述のように「既定値」の設定では、良く用いられるが特徴的な意味をあまり持たない語を省いてある(日本語の場合のみ)。
こちらもどの品詞を表示させるのが良いか試してみると良いだろう。


<共起ネットワークの設定>
「共起関係(edge)の種類」
ここでは語と語、または語と外部変数の共起関係の表示の設定ができる。今回は外部変数は用いていないので「語-語」で設定する。

「バブルプロット」
この項目ににチェックを入れると、語の出現数に対応して円のサイズが変化する。つまり大きい円ほど多く出現している語になる。

「最小スパニング・ツリーだけを描画」
この項目にチェックを入れるとシンプルなネットワークを描くことができる。ネットワークが複雑になったりして見づらいときに使うオプションである。

「共起パターンの変化を探る(相関)」
このオプションを利用することにより相関関係を可視化して物語の進行にともなう変化を読み取ることが出来る。
具体的には、相関を計算する対象を「出現位置」にしてネットワークを描画させると、データの前方(物語の前半)で多く共起している語のペアは青色の線(edge)で結ばれ、データ後方(物語の後半)で多く共起している語のペアは赤色の線(edge)で結ばれる。





<共起ネットワーク描画画面での操作>
中心性とサブグラフ検出
「比較的強くお互いに結びついてる部分」のことを、KHコーダ(KH Coder)では「サブグラフ」と表記される。つまり同じグループといった意味であろう。
共起ネットワークを描画した場合、下部に「カラー:」と表示されているボタンが表示される。これを押すことによりプルダウンメニューで、語(node)の色分け方法を幾つか選択できる。
最初は「中心性」による色分けであり、黄色よりも青色の方が,中心性が高いことを示す。
次は、比較的強くお互いに結びついてる部分を自動的に検出してグループ分けを行い、その結果を色分けによって示す「サブグラフ検出」である。
「modularity」と「random walks」の方法を選ぶことができるが、見やすい方を選ぶと良いだろう。
ちなみに色のついていない語(白色)は、他の語とサブグラフを形成していない単独の語である。また同じサブグラフに含まれる語は実線で結ばれるのに対して互いに異なるサブグラフに含まれる語は破線で結ばれる。
「共起パターンの変化を探る(相関)」にチェックを入れると前述の方法に加えて「相関」が追加される。


その2.「ツール」→「抽出語」→「関連語検索」で検索を行い、下部メニューから「共起ネットワーク」をクリックし起動する方法。

この場合は検索した語に関しての共起ネットワークが表示され、検索の条件として用いた語は二重の正方形で囲んで表示される。
しかし検索語が表示されない場合があったので原因を調べたところ、どうやら対象語が多い場合は二重正方形で囲んで表示されるはずの検索語が表示されない場合があるようだ。
その時は「フィルタ設定」で「最少文書数」の数を増すなどの操作を行う。
この「フィルタ設定」の画面も全体が表示されないにもかかわらず、スクロールバーも表示されないので、もし「OK」ボタンが画面に表示されていない場合はウィンドウを下部に伸ばしてみることも必要のようである。
検索語が表示される以外は、その1の場合とほぼ同じである。

2019年5月1日水曜日

KHコーダ(KHcoder)でテキストマイニング  ~ 抽出語の作成まで ~


本稿の作成に当たってはKHコーダーのマニュアルを参考にさせていただいた。KHコーダーの開発者の樋口耕一先生に謝辞を表したいと思う。また著作権の関係から詳細な内容は割愛した(無断転載に当たる可能性があるので)。興味がある方はKHコーダーのマニュアルを一読されることをお勧めする。
ちなみに、現時点でのKHコーダーのバージョンは3.Alpha.16である。


KHコーダ(KHcoder)は英語にも対応しているらしい。他の外国語も対応しているようだが英語以外は試作段階のようだ。
今回は英語と日本語の両方で同じ題材を使用するので、その違いが分かるかも。

「単純なテキストファイルを使用して分析の一歩目を踏み出す」という目的のため、今回は小説を使ってKHコーダの一般的な使い方で分析を行う。


通常テキストマイニングは外部変数などを使うことが多い。
外部変数というのは、例えばアンケート等で質問に対する回答に付随する属性等で性別であったり年齢、住んでいる場所などの情報である。
今回は外部変数を付与する必要は無いのでテキストのみで行う。

余談だが、KHコーダではテキスト形式だけでなくエクセルファイルやCSV形式のファイルも扱えるらしい。

KHコーダでテキストマイニングを始める前に英文では確認することがある。ダウンロードしたテキストファイル中には、体裁を整えるため右端を改行で体裁を整えてある場合があり、この場合はこの改行を削除する必要がある。
その理由は、KHコーダでは対象の文章を「文」単位と「段落」単位で分析を行うことによる。「文」の場合は句読点で、「段落」の場合は改行で判断する。そのため段落の終わり以外で改行がなされていると「段落」が不正確になり正確な分析ができない可能性がある。そのため不必要な改行を削除する。

その方法はコチラで説明しているので参考にして欲しい。


1.プロジェクトの作成
KHコーダではまず「プロジェクト」の作成から始める。初めての場合は新規作成になる。それからファイルを開く。この時、日本語か英語の選択ができる。

日本語の場合、上部メニューの「前処理」から「分析対象ファイルのチェック」を選んで実行すると分析対象テキストをそのま読込できるのかどうかををチェックしてくれる。
英語の場合は「分析対象ファイルのチェック」はアクティブになっていないので使用できないようだ。まあ英文は26文字しかなく日本語のように多数の文字数は無いので大きな問題無いだろう。


2.前処理の実行
次に「前処理の実行」をクリックする。この「前処理の実行」は対象の文章を分析するため必ず行う必要がある。

3.抽出語の確認
完了したら、上部メニューの「ツール」→「抽出語」→「抽出語リスト」で抽出語の確認ができる。
「抽出語リスト」のみでも抽出語の確認ができるが、パソコンにエクセルが入っている場合には「抽出語リスト(Excel出力)」も行った方が良い。「抽出語リスト」だけでは出現回数が多い順で表示されるため「フィルタ設定」でどの品詞を表示させるか判断が難しいが、「抽出語リスト(Excel出力)」で表示させると抽出語リストが品詞毎に全てエクセルで表示されるので、その判断がしやすくなる。

日本語の場合、フィルタの「既定値」の設定では一般的に用いられるが特徴的な意味を持たない語を省いてある(「する」「ある」「ない」などの語)。
これは日本語だけの設定であり、英語でも「既定値」ボタンは表示されるが押してもフィルタ設定に変化は無い。
以下説明する強制抽出した語は日本語・英語共に「タグ(TAG)」に分類される。

また抽出語リストを確認すると、目的とする語が抽出されていない場合がある。
その時はまず「前処理」→「複合語の抽出」で複合語を抽出する。
それから「前処理」→「語の取捨選択」で表示される画面で、対象の語を「強制抽出」する。「複合語の抽出」でも抽出されなかった場合は「語の取捨選択」で直接入力する。


ここまでは日本語と英語ともにほぼ同じように処理は行える。
しかし英語では別の注意が必要になる。
それは「stop words」の処理で、stop words処理とは英語において頻繁に使用されるが特徴的な意味をあまり持たない語(be動詞など)を表示させない処理のことである。

設定方法は上部のメニューから「プロジェクト」→「設定」をクリックすれば設定画面が表示されるので「stop words」の「設定」ボタンをクリックして設定する。今回はtutorial_en フォルダに同梱されているstop words のリストサンプル(stopwords_sample_en.txt)をそのまま用いた。


図1.KHcoderの設定画面.

結局のところ、日本語の場合はフィルタ設定の「既定値」で、英語の場合は stop words で同じような処理を行うイメージだろう。

そして各種の設定変更を行った場合、必ず再度「前処理の実行」を行うこと。そうしないと変更内容は分析結果に反映されない。

2019年4月29日月曜日

KHコーダ(KHcoder)でテキストマイニング 準備編

KHコーダ(KHcoder)で英文のテキストマイニングをやってみようと思った。

題材は「プロジェクトグーテンベルク」という日本の「青空文庫」みたいなサイトからテキスト形式でダウンロード。

エディタで中身を確認。
するとココで大きな問題を発見する。

体裁を整えるために文章の右側で改行してあるのだ。

↓こんな感じ
His manner was not effusive. It seldom was; but he was glad, I
think, to see me. With hardly a word spoken, but with a kindly
eye, he waved me to an armchair, threw across his case of cigars,
and indicated a spirit case and a gasogene in the corner. Then he
stood before the fire and looked me over in his singular
introspective fashion.


今回使用するテキストマイニングツール「KHコーダ(KHcoder)」では、文章の終わりを句読点で段落の終わりを改行で判断する。
この場合、一つの段落にもかかわらずKHコーダでは6つの段落と判断してしまう。これでは正確な分析はできない。
更には、通常は語と語の間を半角スペースで区切ってあるが文末に改行がある場合はこの半角スペースが無い。
よって修正しようと思うと、半角スペースを挿入して改行を削除(または改行を削除して半角スペースを挿入でも問題無し)という作業が必要となる。
短い文章であれば問題は無いけれど、文章が長いと手間がかかるしタイプミスや操作ミスの可能性もある。

そこで良い方法はないだろうかと調べるとワープロソフトの「ワード」で改行を削除できることが分かった。

以下その手順(Word 2013 の場合)

準備として改行文字が表示されていない場合は表示させる。
1.[ファイル] をクリックして [オプション]
2.[表示] をクリックし、[段落記号] をチェックして [OK]

改行を削除する方法
1.[ホーム] タブをクリックし、編集グループにある [置換] をクリック
2.[オプション] をクリックし、[あいまい検索] のチェックを外す。次に[特殊文字] をクリックして [段落記号] をクリック
3.「検索する文字列」に改行を表す文字列 ^p が入力される。「置換後の文字列」には何も入力しないと削除される。
ここで「検索する文字列」に段落記号 ^p を、「置換後の文字列」に半角スペースを入れて実行すると改行文字は削除され、代わりに半角スペースが挿入される。


以上の作業で改行は削除できた。しかし今度は段落が分からなくなってしまう。そこで良く文章を見ると半角スペースが二つ繋がっている箇所がある(もし半角スペースが表示されていない場合は、段落記号を表示したようにオプションの表示でスペースを表示させる)。
元の段落の場所は、改行が二つ繋がっていた場所で改行を半角スペースに置換させたので半角スペースが繋がっている状態となっているのだ。
よって、同じように今度は半角スペース2つを「検索する文字列」に入れ、「置換後の文字列」に段落記号 ^p を入れる。段落記号を2つ入れても問題無い。一つだと段落同士が隣接するし、二つ入れると段落と段落の間が一段改行される形になる。どちらがいいかはお好みで。

場合によっては改行の前に半角スペースが入ってしまうことがある。この場合も「検索する文字列」に半角スペースと段落記号 ^p を、「置換後の文字列」に段落記号 ^p を入れて置換すると半角スペースは削除される。

どうやらワードだけでなくエクセルでも改行文字の削除はできるようなのだが、今回はワードで目的とする操作ができたのでエクセルの方は調べなかった。興味がある方はご自分で調べてみて下さい。

これで題材の準備はOK。
テキストマイニングの場合、文や段落が重要な意味を持つため文章の区切りを正確にすることが大事である。間違った情報からは間違った結果しか導かない。ご注意を!!

2015年6月15日月曜日

LINE MUSIC(ラインミュージック) 事始め

LINEはエイベックス・デジタル、ソニー・ミュージックエンタテインメントの三社共同出資してLINE MUSIC株式会社を設立したらしい。
このLINE MUSIC株式会社が6月11日にスタートさせたのが、定額制のオンデマンド型音楽配信サービス「LINE MUISC」。
本来は有料サービスだけれど8月9日までは全楽曲・全機能を無料で体験可能となるらしい。ニュースリリースでは「2ヶ月」となっている場合があるが、正確には8月9日まで。これは早速使ってみなければ。

それで早速LINEを立ち上げるがそれらしいサービスは見あたらず。どうやら専用のアプリをダウンロードする必要があるらしい。
グーグルプレイで検索するが、ヒット無し。ど~なってんだぁ。
しょうがないのでアンドロイドの初期画面から「LINE MUSIC」と音声検索。
するとLINE MUSICの案内HPがヒット。ここにグーグルプレイへのリンクが貼ってあったのでコチラからアプリをダウンロードした。

早速立ち上げると、画面が綺麗。ラインのちょっと野暮ったい画面を想像していたがそういうイメージは全く無し。

初期画面にはいろいろとお勧めアーティストなどがあるが、上部に見慣れた虫眼鏡アイコンがあるのでそれで検索が出来る。
検索しているとどんどん階層が深くなっていってトップページに戻るのが大変になる。
そんな時は左端を左から右にスライドさせるとメインメニューが表示される。
ただし、楽曲再生画面では左上の下矢印で表示させる。

気に入った曲があったら再生中であれば「メニュー」から「お気に入り」または「プレイリストに追加」で追加(プレイリストの場合は作成も)可能。
この「お気に入り」と「プレイリスト」には左スライドで表示されるメインメニューの「マイミュージック」で見ることが出来る。

作成したプレイリストを削除する場合には「マイプレイリスト」の横の「全てみる」で一覧を表示させてトップにある「マイプレイリスト」の下の「編集」をタップすると削除できる。
プレイリストの曲を削除したり曲順を変更する場合は目的のプレイリストを表示させて同じようにプレイリスト名の下の「編集」をタップして編集画面で行う。
なお削除する場合は削除するプレイリストやアルバム・楽曲を選択して「削除」をタップした後に右上の「閉じる」をタップしないと削除できない(「削除」→「戻る」では削除されない)ので注意が必要。

面白いのは、楽曲再生画面でジャケットイメージ(アートワーク)をタップすると再生曲の歌詞が表示される(ただし曲によっては歌詞が無い場合もあるようだ)。これはありがたいなぁ。

当然ながらエイベックスとソニーミュージックのミュージシャンのみのサービス提供だが、しかしどうやらエイベックスは少ない(またはまだ追加されていない)感じ。

ソニーミュージックの邦楽ミュージシャンは下記のサイトから確認できるので参考まで。

ソニーミュージック邦楽ミュージシャンリスト


8月9日までなので興味がある方は早めに試した方が良い。
しっかり楽しんで引き続き利用するかどうか考えよう。


2015年2月6日金曜日

東芝レグザの RZスイート express

自分はテレビやレコーダーなどのAV機器は東芝のレグザ(REGZA)シリーズを愛用している。
なぜなら、レグザはアナログの時代にはネットワーク関係に進んだ機種だったからだ。
アナログ放送時代のレグザにはネットdeダビングという機能があり、同じネットワーク内のレグザ同士でダビングが出来た。この機能を利用してダビング先をPCにすることもフリーのソフトを使って可能であった。

デジタル放送になった現在でも自分のTVとブルーレイレコーダーもレグザ。
具体的にはTVは32HE1
ブルーレイレコーダーはDBR-Z310

地デジになってもそんな流れから何となくレグザを使っている。ネットワーク関係はだいぶん縮小されたが、増設用にHDDにパソコン用のHDDが使用出来るのはありがたい。現在は他メーカーでもPC用HDDが使える機種が増えたがレグザはその先駆けだったと思う。

そんな中、先日中古ながら新しいノートPCを購入。
PCは別に東芝にこだわっていなかったが、たまたま東芝のダイナブックを購入。
スタンダードタイプとうたっていたがスペックはなかなか。

それ以来、東芝のネットワークに対する姿勢から考えてレグザとダイナブックをつなげることが出来ないかなと考えていた。

そこで調べてみると方法があった。
「TVコネクトスイート」と「RZスイート express」の二つ。どちらも東芝のオリジナルアプリ。
しかし「TVコネクトスイート」ではマウスとキーボードはサポートされていない(タッチスクリーンのみ対応)ので通常のタッチパネルが無いPCでは使用できず。
結局、一般的なPCでは「RZスイート express」を使うことになる。

以下はPCは東芝ダイナブックT554、ブルーレイレコーダーはDBR-Z310を用いた場合であることをご了承願いたい(TVのHE1はRZスイートには対応していない)。

「RZスイート express」には「RZプレーヤー express」「RZライブ express」「RZポーター express」の3種類のアプリが含まれている。

「RZプレーヤー express」はテレビやレコーダーに録画した番組を視聴できる。
「RZポーター express」はテレビやレコーダーに録画した番組を、PCにダビング可能。外出先にPCを持ち出せば、空いた時間に楽しむことができる。
「RZライブ express」はレコーダーで受信している放送中のテレビ番組をライブ配信して視聴できる。

現在、「RZスイート express」がインストールされているPCとレグザレコーダーを同じネットワークにつなげている。具体的には同じルーターのHUBに接続している。

早速「RZプレーヤー express」を立ち上げるとあっさりレグザレコーダーが認識され、録画している番組をダイナブックで簡単に観ることが出来た。
この場合、レコーダーの電源が入っていなくてもRZレコーダーを操作すると自動で電源が入る(無論コンセントを抜いていたら無理だけど)。

「RZポーター express」を用いて録画番組をPCに移動させようとしたがコチラは多少の作業が必要。RZプレーヤーのように単純にポーターを立ち上げても「ファイルが見つかりません」のメッセージが表示される。ポーターを使うためにはレコーダー側で作業が必要になる。

具体的には次の通り。
ブルーレイレコーダーのダビング機能から「持ち出し用変換」で録画している番組を選択。これを持ち出し用に変換する(変換は等倍速のみで行われる)。この場合、変換レートも選択できる。「持ち出し用変換(LAN)」というメニューもあるがこの時点では選択できない。

番組の変換が完了したら今まで選択できなかった「持ち出し用変換(LAN)」が選択できるようになっている。
それで「持ち出し用変換(LAN)」を選択するとダビング先機器選択画面が表示され、LANで接続された機器が表示される。そのうち「RZスイート express」がインストールされたPCのダイナブックを選択。
持ち出し番組一覧が表示され、目的の番組を選択すると「ダビングすると、番組はダビング元に残りません」とメッセージが表示されるので「はい」を選択する。
メッセージの意味はムーブのみでコピーは出来ないということ。ムーブされるのは変換された番組で、変換元の番組は残る(当然コピー可能回数は減る)
実行をすると持ち出し用に変換した録画番組がダイナブックに移動される。画質(変換レート)はそのままでも今回は高速ダビングとなる。
確かに、変換スピードよりダビングスピードは速い。

再生はRZポーターで行う。
RZポーターを立ち上げると、ダビングされた番組が表示されるのでそれを選択すると無事再生された。

以上の操作をまとめると、RZポーターにおいて再生以外の操作はレコーダー側で行い、ポーターでは再生のみ行うということになる。
一方RZプレーヤーはPCのみで操作でき、レコーダー側の操作は必要ない。

RZプレイヤーは別として、RZポーターをどう考えるかだと思う。
というのも、目的とする番組をブルーレイディスクにダビングしてファイナライズ処理をするとダイナブックでも観ることが出来る。
この方法としては
レコーダーに録画した番組をブルーレイディスクにダビング→ディスクをファイナライズ処理→PCのドライブに挿入→鑑賞
もちろんこの場合はPCのドライブはブルーレイドライブが必要となる。
一方RZポーターでは
録画した番組を持ち運び変換→変換した番組をRZポーターが入っているPCにLANで移動→RZポーターを立ち上げ鑑賞
となり、手間的には余り変わらない。
さらにはディスクにダビングした場合は録画した画質で観ることが出来るが、持ち出し変換すると画質が落ちる(変換レートで画質を調整することは可能)。
ただしメーカーとしてはディスクにダビングしファイナライズ処理をした場合、すべての場合で処理をした機器以外の他のプレイヤー(PCを含む)での再生を保証していない。画質が綺麗だからとディスクに焼いてもPCで再生できない場合もあるということだ。その点RZポーターではその可能性はかなり低くなると思われる。
もちろんブルーレイディスクを使用するとブルーレイドライブも必要となりディスク費用が必要となる。

以上を考えると、録画した番組をPCで持ち出す場合どちらを選ぶか、難しい選択だなぁ。まあケースバイケースということになるのだろうか。


残りの「RZライブ express」だが、こちらはレコーダー側で
ネットワーク設定→ネットdeナビ/レグザリンク連携設定→レグザリンクシェア設定
でIDとパスワードを設定。

これをRZライブの設定画面でのIDとパスワードを合わせる。

これでRZライブを立ち上げると、放送中の番組をPCで観ることが出来る。

家族で各個人が部屋にTVが無くてもLAN経由でPCでTVを観ることが出来る。
ただし、使い勝手はイマイチ。

RZライブを立ち上げると、いきなりTV放送の画面になる。チャンネルを変える場合には右上の矢印をクリックすることになるが、これに関しては全く説明が無く、マウスの右クリックでもメニューは表示されない。
さらにはチャンネル選択画面では同じチャンネルが複数表示される。たぶんマルチチャンネル対応なんだろうけど、表示されるのはチャンネル数字だけでそのチャンネルに対応しているTV局名は表示されず分かりにくい。決定的なのは番組表がRZライブでは表示されないので、現在放送中の番組や観たい番組は別途番組表を入手する必要がある。使いやすさを考えてあるとは思えないなぁ。
部屋でTVを観る場合、これを主として使うかどうかは微妙なとこだ。


そうしているうちに、東芝がTV事業から撤退というニュースが飛び込んでいた。もう自社ではレグザTVは作らないらしい。今後のレグザのネットワーク機能がどうなるか、気になるところだ。

2015年1月23日金曜日

GoogleドキュメントのOCR機能

GoogleドキュメントにはOCR機能がある。当然これはフリーで使えるOCR。
どんな感じが使ってみようと思い使い方をネットで調べたが、どうやらやり方がかなり変わっていてネットで調べた内容は古い情報ばかりで使い方がよく分からない。

いろいろと調べて試行錯誤をして何とか使い方が分かった。
おおよそ次の通り(2015年1月20日現在)。

まず重要なのはグーグルドキュメントのOCR機能はグーグルドキュメント単体では設定できないということ。古い情報ではグーグルドキュメント単体で使用できるように書いてあるが現在では出来ない。グーグルドライブとグーグルドキュメントの二つが必要のようようだ。。
まあ通常グーグルドライブは入っていることが多いが、入ってなければこの二つを入れておく必要がある。

今回はGoogleクロームを使った場合の説明となる。
他のブラウザはそれぞれ調べてみて下さい。

グーグルクロームでは立ち上げると「アプリ」というボタンが左上にあるのでそれをクリックすると入っているアプリが確認できる。ここで「Googleドライブ」と「Googleドキュメント」があることを確認しておく。

OCRの設定はグーグルドライブで行う。
クロームの「アプリ」をクリックしてグーグルドライブを立ち上げる。それから右上の歯車の形をした「設定」アイコンを選ぶ。
このアイコンにマウスを置くと「設定」という説明が出てくるので確認できると思う。

クリックすると「設定」「ドライブをダウンロード」「以前のドライブに戻す」「ヘルプ」のメニューがあるので、もちろん「設定」をクリック。

すると「全般」と「アプリの管理」があり、その「全般」を選択。

「全般」の中の「アップロードしたファイルを変換する」の「アップロードしたファイルを Google ドキュメント エディタ形式に変換します」にチェックを入れる。
以前はもっと多くの設定内容があったようだが現在はこれだけのようだ。

また、「言語」の「言語設定を変更」をクリックすると日本語とその他の理解できる言語の設定ができる。その他の言語は英語を選ぶ人が多いと思う。
設定が終わったら、「言語」の横の「←」をクリックして前の画面に戻る。このとき「設定」の画面でなくグーグルドライブのメイン画面の戻るので、再度「設定」→「設定」で「完了」をクリックする。

これで設定は終了。

次にファイルのアップロード。同じくこれもグーグルドライブから。
今度は左上の「新規」ボタンをクリック。
すると「フォルダ」「ファイルをアップロード」「フォルダをアップロード」など出てくるので、目的とするメニューをクリック。
ファイルをアップロードする場合は当然「ファイルをアップロード」をクリック。
クリックするとファイルを選択する画面が出てくるので目的とするファイルを選ぶとアップロードが始まる。

完了すると、アップロードしたファイル名が表示される。
これを選んで右クリックすると「アプリで開く」というメニューがあるので、その中のGoogleドキュメントを選ぶ。
するとGoogleドキュメントが立ち上がり、選んだファイルが表示されその下にOCRの結果が表示される。

以前のバージョンでは、アップロードするたびにOCRを使うかどうか設定することが出来たようだが現在では出来ないようだ。
前と比べて簡素化されている感じ。

で、実際に使ってみた感想だが、pdfファイルでは上手く読み取れることもあったが、jpgでは上手く読み取れないことが多かった。
結論的なことは言えないが、条件を変えたらjpgでもひょっとしたら使えるようになるかもしれない。
今度時間があるときにやろうかな。たぶんやらないだろうなぁ。