<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>TF-IDF on Data Visualization Japan</title>
        <link>https://data-visualization.jp/tags/tf-idf/</link>
        <description>Recent content in TF-IDF on Data Visualization Japan</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>ja-jp</language>
        <lastBuildDate>Tue, 27 Dec 2022 00:00:00 +0000</lastBuildDate><atom:link href="https://data-visualization.jp/tags/tf-idf/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>LT：林 尚芳／「俯瞰」可視化が情報探索・分析を変える</title>
        <link>https://data-visualization.jp/overview-visualization/</link>
        <pubDate>Tue, 27 Dec 2022 00:00:00 +0000</pubDate>
        
        <guid>https://data-visualization.jp/overview-visualization/</guid>
        <description>&lt;img src="https://data-visualization.jp/overview-visualization/cover.jpg" alt="Featured image of post LT：林 尚芳／「俯瞰」可視化が情報探索・分析を変える" /&gt;&lt;p&gt;Data Visualization Japan Meetup 2022（2022年12月27・28日開催）における、林 尚芳さん（株式会社VALUENEX）のLTです。前年の講演で紹介した「俯瞰図」について、そのアルゴリズムと背景思想を掘り下げます。&lt;/p&gt;
&lt;hr&gt;
&lt;div class=&#34;video-wrapper&#34;&gt;
    &lt;iframe loading=&#34;lazy&#34; 
            src=&#34;https://www.youtube.com/embed/RgOHeHJ6Pok&#34; 
            allowfullscreen 
            title=&#34;YouTube Video&#34;
    &gt;
    &lt;/iframe&gt;
&lt;/div&gt;

&lt;p&gt;「俯瞰可視化が情報探索・分析を変える」というタイトルでお話しさせていただきます。&lt;/p&gt;
&lt;h2 id=&#34;自己紹介&#34;&gt;自己紹介
&lt;/h2&gt;&lt;p&gt;&lt;strong&gt;VALUENEX&lt;/strong&gt; という会社に所属し、&lt;strong&gt;研究開発推進のための調査・データ分析&lt;/strong&gt;をやっています。クライアント企業の研究本部の方が多く、&lt;strong&gt;研究戦略を考える上で必要な特許・論文・スタートアップといった情報を分析して知見をお渡しする&lt;/strong&gt;ということを普段やっています。&lt;/p&gt;
&lt;p&gt;プライベートでは、&lt;strong&gt;これまで東京に住んでいたのですが今年関西に移住&lt;/strong&gt;しました。**会社は東京にあるのですがフルリモートで働いています。**関西移住に興味があるという方もぜひお声がけください。&lt;/p&gt;
&lt;h2 id=&#34;前回の振り返り&#34;&gt;前回の振り返り
&lt;/h2&gt;&lt;p&gt;実は昨年もお話しさせていただきました。テーマは「&lt;strong&gt;科学技術情報分析の面白さ&lt;/strong&gt;」です。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;特許や論文といった科学技術情報は人類の叡智が蓄積された情報源&lt;/strong&gt;であり、&lt;strong&gt;データ分析や可視化によって面白い情報を抽出できるので、ぜひ皆さんもやってみてください&lt;/strong&gt;という啓蒙活動でした。&lt;/p&gt;
&lt;p&gt;その事例の一つとして紹介したのが「&lt;strong&gt;俯瞰可視化&lt;/strong&gt;」です。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;データ可視化に関する研究論文を約3万件集めて可視化した&lt;/strong&gt;もの——&lt;strong&gt;「データ可視化の可視化」&lt;/strong&gt; と呼んでいました。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;一つ一つのプロットが論文で、アブストラクトが似ているものを近くに、似ていないものを遠くに配置&lt;/strong&gt;しています。&lt;strong&gt;点が密集しているところは一定の技術領域&lt;/strong&gt;になっていて、大きくまとめると——データマイニング、テキストマイニング、動きの分析、バイオ・医療、シミュレーション、レンダリング、インタラクション、モバイル・IoT——&lt;strong&gt;基礎技術から応用まで幅広く見える。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;3万件を読まなくても、まず全体像を見て、その上で時系列推移やプレイヤー別に見ることで技術動向を把握できる。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;今回は、&lt;strong&gt;この俯瞰可視化というアプローチそのもの&lt;/strong&gt;について——&lt;strong&gt;アルゴリズム&lt;/strong&gt;、&lt;strong&gt;背景思想と情報探索・分析を変える可能性&lt;/strong&gt;、そして&lt;strong&gt;関連プレイヤー&lt;/strong&gt;の3つをご紹介します。&lt;/p&gt;
&lt;h2 id=&#34;-アルゴリズム&#34;&gt;① アルゴリズム
&lt;/h2&gt;&lt;p&gt;距離を求めてプロットするには、&lt;strong&gt;文章をある程度数値化&lt;/strong&gt;しなければなりません。&lt;strong&gt;数値化さえできれば距離計算ができます。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;文章の場合は&lt;strong&gt;単語&lt;/strong&gt;でやります。&lt;strong&gt;単語と文書のマトリックス&lt;/strong&gt;を作り、「&lt;strong&gt;単語1は文書1に対して0.4くらいの重要性がある、単語2は全くない、単語3は0.2くらい&lt;/strong&gt;」というスコアを計算する。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;このスコアを一つのベクトルとみなす&lt;/strong&gt;と、「文書1と文書2のベクトルは結構似ている」「文書3はちょっと違う」といった計算ができるようになります。&lt;/p&gt;
&lt;h3 id=&#34;重要性スコア--tf-idf&#34;&gt;重要性スコア ― TF-IDF
&lt;/h3&gt;&lt;p&gt;有名なところでは &lt;strong&gt;TF-IDF&lt;/strong&gt; があります。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;単語1が文書1にたくさん出てきたら重要&lt;/strong&gt;（出現頻度に基づいて高くなる）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;ただし、文書1にも2にも3にもその単語がたくさん出てくるなら、文書1の特徴語とはみなせない&lt;/strong&gt;（偏在度で減る）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;つまり**「その文書でよく出てきて、かつその文書にしか出てこない単語」が高くなる**スコアリングです。&lt;/p&gt;
&lt;h3 id=&#34;次元圧縮&#34;&gt;次元圧縮
&lt;/h3&gt;&lt;p&gt;ベクトル化すると、&lt;strong&gt;似ているものが近くに配置されます。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;図では3次元で表していますが、&lt;strong&gt;実際の単語数は数千・数万あるので、本当は数万次元。人間が理解できない次元数&lt;/strong&gt;になってしまいます。&lt;/p&gt;
&lt;p&gt;そこで&lt;strong&gt;関係性をなるべく保ったまま2次元に圧縮&lt;/strong&gt;します。方法はいくつかあり——&lt;strong&gt;多次元尺度構成法（MDS）、主成分分析、t-SNE、UMAP&lt;/strong&gt;など。&lt;strong&gt;ここも日々新しいものが提案されています。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;ベクトル化手法も TF-IDF は一つの方法&lt;/strong&gt;で、他に&lt;strong&gt;トピックモデルや Doc2Vec&lt;/strong&gt; などがあり、&lt;strong&gt;こちらも日々進化&lt;/strong&gt;しています。&lt;strong&gt;データ分析者はベクトル化手法と圧縮手法を組み合わせて俯瞰可視化を作る&lt;/strong&gt;わけです。&lt;/p&gt;
&lt;h2 id=&#34;-なぜ俯瞰可視化が必要なのか&#34;&gt;② なぜ俯瞰可視化が必要なのか
&lt;/h2&gt;&lt;p&gt;私たちが情報探索をするとき見慣れているのは、&lt;strong&gt;検索してリスト表示する&lt;/strong&gt;というやり方です。&lt;/p&gt;
&lt;p&gt;lens.org で「データビジュアライゼーション」と検索すると&lt;strong&gt;3万件&lt;/strong&gt;ヒットします。ページ送りもできますが——&lt;strong&gt;果たしてこの3万件を全部読みますか。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;Google や Yahoo! で検索した時も、結局は上の方しか見ないのではないでしょうか。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;そして&lt;strong&gt;リスト表示では、隣り合ったものが似ているのかも分かりません。&lt;/strong&gt;「これはネットワークやサービスマネジメントのデータビジュアライゼーション、これは図書館に関するデータビジュアライゼーション」——&lt;strong&gt;隣り合っているけれど、似ているのかどうか分からない。おそらく似ていない。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;つまり——&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;全部見られず、上位のものに目が行きがち&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;隣り合った検索結果間の関係性が見えない&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;strong&gt;このままだと、全体像が分からないまま一部の情報だけを見てしまう。それが視点の漏れや知識発見の機会損失につながる&lt;/strong&gt;のではないか。&lt;/p&gt;
&lt;h3 id=&#34;overview-first-zoom-and-filter-details-on-demand&#34;&gt;Overview first, zoom and filter, details-on-demand
&lt;/h3&gt;&lt;p&gt;そこで&lt;strong&gt;全ての情報を使って俯瞰可視化をしてしまい、その上で情報探索・分析を行う。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;やり方として有名なのが、&lt;strong&gt;シュナイダーマンが提案した情報可視化の設計指針&lt;/strong&gt;です。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;まず全体像を見て、重要な局所に注目し、不要な局所は割愛して、必要に応じて詳細情報を探索する。&lt;/strong&gt;&lt;/p&gt;&lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;これがまさしくできる&lt;/strong&gt;のではないかと思っています。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;【Overview first】&lt;/strong&gt; 全体像を見たとき、&lt;strong&gt;自分が思っていなかった・知らなかった領域があれば、その時点で視点の漏れや知識の漏れに気づける。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;【Zoom and filter】&lt;/strong&gt; 興味のある分野があればそこに絞り込む。たとえば図書館に興味があるなら「library」を含む論文だけを可視化して表示する。&lt;/p&gt;
&lt;p&gt;すると——&lt;strong&gt;まず図書館情報の領域に集中している&lt;/strong&gt;のでそこを重点的に見る。&lt;strong&gt;一方でその周辺には、論文分析・文書分析・知識発見・検索エンジン・ビッグデータが取り巻いている。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;図書なので文章系のテキストマイニングや検索エンジンが近い。近いものが近くに存在している&lt;/strong&gt;わけです。**そこだけを見るのではなく、テキストマイニングの領域も見て「図書館に活用できないか」と考えることもできる。**&lt;strong&gt;興味ある部分＋その周辺も探索しやすい。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;【Details on demand】&lt;/strong&gt; 図書館情報の中を見ると、&lt;strong&gt;よく使われている特徴語、研究者一覧、論文リスト&lt;/strong&gt;が見られて理解が深まる。&lt;/p&gt;
&lt;p&gt;その上で&lt;strong&gt;次にどういう探索をしようか&lt;/strong&gt;を考える——「library」だけでなく「&lt;strong&gt;digital collection&lt;/strong&gt;」や「&lt;strong&gt;knowledge management&lt;/strong&gt;」という文脈で次は検索してみよう、とか。&lt;strong&gt;「この領域でトップの研究者はブラッド・エデンさんだから、彼の研究を中心に見てみよう」&lt;/strong&gt; とか。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;自分の興味の範囲を少しずつ拡張して、次の探索の起点を見つけ出せる。&lt;/strong&gt;&lt;/p&gt;
&lt;h3 id=&#34;デモ&#34;&gt;デモ
&lt;/h3&gt;&lt;p&gt;実際に「library」がタイトルと要約に入っているものだけを表示すると、&lt;strong&gt;図書館情報のところに集中して出てきます。&lt;strong&gt;クリックすると&lt;/strong&gt;特徴語リスト&lt;/strong&gt;が出てきて、どんな言葉がよく使われているか、どんな研究者がいるか、時系列で最近伸びているのか減っているのか、実際にどんな論文があるのか——&lt;strong&gt;それを把握して次の探索につなげていく。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;検索してリストで見て中身を見ていくというやり方もいいのですが、それでは漏れてしまう視点や知識発見の機会損失を、このようなやり方で補填できる&lt;/strong&gt;のではないかと考えています。&lt;/p&gt;
&lt;h2 id=&#34;-関連プレイヤー&#34;&gt;③ 関連プレイヤー
&lt;/h2&gt;&lt;h3 id=&#34;valuenex&#34;&gt;VALUENEX
&lt;/h3&gt;&lt;p&gt;手前味噌で申し訳ないのですが、弊社です。&lt;strong&gt;創業者の中村がシンクタンク時代に感じていた情報探索・分析の課題をもとに、この俯瞰解析というアプローチを考案して起業&lt;/strong&gt;しました。&lt;/p&gt;
&lt;p&gt;ミッションは「&lt;strong&gt;世界に氾濫する情報から知を創造する&lt;/strong&gt;」。まさしくこのやり方でお客様に知を提供しています。&lt;strong&gt;量子コンピュータの分析例&lt;/strong&gt;など、いろんな事例を Twitter でも発信しています。&lt;/p&gt;
&lt;h3 id=&#34;東京大学俯瞰経営学講座&#34;&gt;東京大学「俯瞰経営学講座」
&lt;/h3&gt;&lt;p&gt;企業だけでなく、&lt;strong&gt;東大でも「俯瞰経営学講座」&lt;/strong&gt; が行われていました。&lt;strong&gt;現在は一般社団法人 俯瞰工学研究所&lt;/strong&gt;になっているそうです。&lt;strong&gt;論文の俯瞰マップや、講座の内容が本にまとまっている&lt;/strong&gt;ので、興味のある方はぜひ。&lt;/p&gt;
&lt;h3 id=&#34;nomic--世界初の情報地図制作会社&#34;&gt;Nomic ― 世界初の「情報地図制作会社」
&lt;/h3&gt;&lt;p&gt;&lt;strong&gt;私が今一番興味がある会社&lt;/strong&gt;です。&lt;strong&gt;2022年に創業されたアメリカのスタートアップ&lt;/strong&gt;で、自分たちのことを——&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;the world&amp;rsquo;s first information cartography company&lt;/strong&gt;（世界初の情報地図制作会社）&lt;/p&gt;&lt;/blockquote&gt;
&lt;p&gt;と言っています。&lt;/p&gt;
&lt;p&gt;彼らが作ったマップの一つが&lt;strong&gt;ウクライナ侵攻のニュースをマッピングした図&lt;/strong&gt;です。カーソルを合わせるとサマリーが出て、検索やフィルタリングもできるツールを提供しています。&lt;/p&gt;
&lt;p&gt;他にも制作物を発表していて——&lt;strong&gt;Stable Diffusion などの AI による画像生成で、世の中にどんな画像が生成されているのかをマッピング&lt;/strong&gt;したものもあります。マウスオーバーすると生成画像が見えて、&lt;strong&gt;このあたりが動物、このあたりが街の風景&lt;/strong&gt;、と分かる。&lt;strong&gt;「japan」で検索すると、日本の都市らしい画像が集まって見える。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;そしてもう一つ面白いのが、&lt;strong&gt;最近ベン・シュミットさんがこの会社の Information Design の責任者に就任された&lt;/strong&gt;こと。&lt;strong&gt;彼はもともとニューヨーク大学のデジタルヒューマニティーズが専門の教授&lt;/strong&gt;でした。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;そういう方が俯瞰可視化に注目して、情報探索・情報分析を変えようとされているのが非常に面白いし、共感するな&lt;/strong&gt;と思っています。Twitter で制作物をどんどん発表している会社なので、フォローしておくと面白いのではないでしょうか。&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;以上、俯瞰可視化についてご紹介させていただきました。ご清聴ありがとうございます。&lt;/p&gt;</description>
        </item>
        
    </channel>
</rss>
