jnobuyukiのブログ

JavaScriptとR言語を中心に研究活動に役立つwebアプリケーション技術について考えていきます。twitter ID: @j_nobuyuki

なぜ分散分析には自由度が2つあるのか?

今回は、分散分析という解析方法の紹介をします。 平均値の差の検定です。 分散分析は、3つ以上の条件やグループがあるときの平均値の条件差・グループ間の差を比較するときに使います。確率の考え方を取り入れることで、平均の差が偶然と呼べる程度の差な…

卒論でよく言われる「まだ検討されていない」研究テーマについて思うこと

大学の卒業論文の季節ですね。今回は、卒業論文でよく見られる表現について考えたことを書きます。 科学が目指すもの 科学が目指すものは「新たな知の獲得」です*1。今まで誰も知らなかったことを調べてみて、面白い結果が得られたらそれを皆で共有します。…

大学での授業ノートを貸し借りについて思うこと

今回も、日常的なテーマで思うことを書いてみます。今回のテーマは、一部の大学生にとって悩みの種になるようなもので、検索するといろいろな意見が飛び交っていて面白いです。例えばdetail.chiebukuro.yahoo.co.jp 上記のような悩み相談が数え切れないほど…

統計学を通して見える世界

今回は、統計学に基づいた研究の意義や世界の見え方について思うことを書きます。 研究にとっての統計的仮説検定というツール 研究では、何らかのアイデア(仮説と呼びます)が、実際に何かの現象をうまく説明できたり、何かに役立ったりすることなどを検証…

R言語で複数の変数を集計(2)

今回は、前回の内容の続きで、複数の変数の内容を1つの変数にまとめる方法を紹介します。 複数の変数に別れた条件名を1つにまとめたい 以下のデータフレームでは、ある条件に該当するかどうかが複数の項目への解答として記録されています。 参加者 条件A …

R言語で複数の変数を集計

今回は、アンケート項目の集計などに用いるような複数項目の集計方法を紹介します。 rowSums関数の利用 各個人が次のようにアンケートに答えたとします。 参加者ID 質問1 質問2 質問3 A 1 1 0 B 0 1 0 C NA NA NA D NA 1 0 1は「はい」、0は「いいえ」、N…

R言語でデータフレームのデータを並べ替え

今回はR言語でデータを扱うときのちょっとした技の紹介です。 データの並べ替え 複数の変数で構成されるデータフレームオブジェクトについて、任意の変数の昇順で、ケースを並べ替えたい場合は、order関数を利用します。 #データ data <- data.frame(x = c(1…

子供が使うPCのスペック

今回は、タイトルの内容について思ったことをただそのまま書いてみたいと思います。 予算だけを言えば、できるだけ抑えたい PCの価格は常に下がり続けています。以前なら30万円を超えるような PCと同等性能のPCが10万円、場合によってはそれ以下で購入で…

R言語でパターンマッチング

今回は、R言語で正規表現を利用したパターンマッチングの使用例を紹介します。 R言語のパターンマッチング:grepの場合 特定のテキストや文字列のリストに対して、任意のパターンを検索します。文字列がパターンを含んでいるとリスト内の位置を戻り値として…

R言語でデータフレームの一部を参照する方法(2)

前回、データフレームの一部の参照についてまとめました。今回はその補足です。webbeginner.hatenablog.com リスト形式での参照 データフレーム形式のオブジェクトに以下のようにアクセスするとデータの一部のみが参照されますが、その形式はデータフレーム…

R言語でデータフレームの一部を参照する方法

今回は、データフレームオブジェクトの一部を取り出す方法を紹介します。ほんの少しの違いですが、取り出した結果を他の処理に利用するときには重要な違いになるので、割と大事な内容です。 R言語のオブジェクト R言語では、いろいろな構造のオブジェクト(…

R言語でパイプ処理を利用してコードを見やすく

今回は、R言語のコードそのものを見やすくするという話です。 Rでのコードの書き方 R言語では、型を指定しないオブジェクトにデータやその下処理・解析結果を一時的に保持するのが典型的です。例えば以下のコードは、入力データ、下処理後データ、解析結果が…

統計的に有意となる相関係数を自由度と有意水準から逆算する

今回は、ちょっとややこしい話。2つの変数の関連性を数値の変動の仕方から推定する方法があります。例えば、一方が増えると他方も増えるのか?それとも減るのか?もしくは変わらないか。これを表す指標の一つが相関係数です。相関係数を計算する方法は、検…

RマークダウンファイルでGhostscriptに関するエラーへの対処

今回は、RStudioを使っている時に出てきたエラーへの対処をメモ代わりにまとめておきます。 RマークダウンファイルからPDFファイル作成 RStudioでは、Rマークダウン形式ファイルがあり、マークダウン形式のテキスト、Rコード、出力結果、グラフを一つのファ…

可視化で理解する中心極限定理

今回は、Data Visualization Advent Calendar 2015への寄稿として書きます。qiita.com データを特徴づける指標にはいろいろなものがあります。例えば、算術平均は分布の中心を表す代表的な指標です。これに加えて、データの形状やばらつきを把握すると、より…

Rマークダウンファイルで日本語を使う時のヒント

今回は、前に紹介したRマークダウンファイルについて、特に日本語テキストを扱うときに役立つ方法を紹介します。webbeginner.hatenablog.com 日本語のテキストが折り返されない そうなんです。前回紹介したやり方でフォントをうまく選べば、日本語も問題なく…

Processing始めました

今までJavaに関連したプログラミング言語を学んだことがなかったのですが*1、いろいろ理由があってProcessingを始めました。本日はまず、始め方と日本語環境についてまとめます。なお、今回はmacへのインストールを前提にしています。 まずはインストール Pr…

R言語で1サンプルのt検定

今回はRを用いて1サンプルのt検定(母平均の検定)について考えてみます。 1サンプルのt検定とは? 仮説として仮定された母平均に対して、サンプルから推定された母平均との差の統計的有意性を検定します。 もう少し普通の言葉で言うならば、収集したデー…

書評「新米探偵データ分析に挑む」

今回は、Rに関する書籍の書評に挑戦してみます。 石田基弘(著)「新米探偵データ分析に挑む」 こちらです。 Amazon CAPTCHAこの書籍は、ライトノベルとR(正確にはRStudio)を利用した統計解析の解説が一つになっています。 主人公の田中くんは、探偵事務所…

Rマークダウンファイルで使えるフォントを選ぶ

RのIDEであるRStudioではknitrやrmarkdownといったパッケージを利用して、テキスト、Rスクリプト、出力結果、グラフを一つのファイルに出力できます。その際、TeXを利用するとPDFファイル出力が可能です。しかし、実際にこれをやろうとすると結構やることが…

文系と理系の溝

本日は文系と理系の間にあると感じられる溝について考えてみたいと思います。 文系と理系の違い まず、文系と理系の違いについて簡単に考えてみます。下世話な言い方をすれば、これは高校における科目履修の違いです。どれだけ自然科学系の科目(数学や理解…

Unity C#で時間の取得

突然ですが実験的な研究のフレームワークとしてUnityを使い始めました。Unityはコーディングなしでも手軽にゲームを作成できる強力なツールです。(なんでUnityなのかはまた別の機会に書きます。)今回は、Unity内で時間を取得する方法をまとめておきます。 …

R言語でワードクラウドを作る

今回は、R言語のwordcloudパッケージを利用して、アンケートの自由記述回答をwordcloud形式で表現する方法をまとめます。 ワードクラウドとは? コトバンクによれば「文章中で出現頻度が高い単語を複数選び出し、その頻度に応じた大きさで図示する手法」との…

R言語でパッケージから関数を呼び出す

本日は、なんとなく気になっていた関数の呼び出し方のバリエーションをまとめておきます。 パッケージ内の関数 R言語の最大の強みの一つは、パッケージによる機能拡張でしょう。世界中の開発者がオープンな環境で次々に強力な関数を開発して公開しています。…

R言語で形態素解析

今回は、MeCabというオープンソースの形態素解析エンジンをRから使えるようにする方法を紹介します。いろいろな場所ですでに紹介のある内容ですが、紹介されているページのリンク先が有効でないこともあるので、2015年7月8日現在のやり方としてまとめ…

調べてみたら予想と違ったときに思うこと

最近はずっとR言語に関するまとめが続いたので、たまには単純に考えたことを書きます。 予想が外れるのは「失敗」か? 研究に関する色々な過程の中でも一番楽しいのは、実験や調査によって収集したデータを解析し始める瞬間です。「ああかもしれない」「こう…

R言語でウェブページから情報を抽出

今回は、R言語を利用してウェブページからデータとなる情報を抽出する(いわゆるスクレイピング)方法をまとめます。 参考にしたページ abrahamcow.hatenablog.comqiita.com XMLパッケージ ウエブページを書くための言語であるHTMLは、タグ形式で表現される…

R言語でデータの並べ替え

今回はR言語でデータの並べ方を変える方法を紹介します。 具体例 具体例を見てもらうのが一番わかりやすいので、先に何をしたいのかを示します。 例えばあるデータがこんな風に並べられているとします。 ID preTest postTest 1 100 90 2 85 95 これをこのよ…

R言語でデータセットの一部を抜き出す

今回は、データの一部を抜き出すときに便利なsubset関数の使い方をまとめます。 subset関数 subset関数の引数は以下の通りです。 x データフレームオブジェクト subset 抜き出す条件式 欠損値は自動的に除外されます select 抜き出す変数名。データフレーム…

IPythonからJupyterへの移行とR用カーネルの導入

前回、ipython notebookをOSXに導入する方法をまとめました。webbeginner.hatenablog.comそこでも少しだけ書いたのですが、ipythonはどんどん進化しており、python以外のプログラム言語も動くようになってきています。そこで今回はipythonからJupyterへの移…