スキップしてメイン コンテンツに移動

Rでオブジェクト指向プログラミング: S4クラスの定義

第5回目です。いよいよコードを読んできます。

ファイルの配置とS4クラス・メソッドの定義の関係


Rディレクトリにこのパッケージのソースが含まれています。各々のファイルをみてきましょう。

[code]
tree GOstats
GOstats/
|-- DESCRIPTION
|-- NAMESPACE
|-- R
| |-- AllClasses.R
| |-- AllGenerics.R
| |-- GOHyperGResult-accessors.R
| |-- GOgraph.R
| |-- GOhyptest.R
| |-- hyperGTest-methods.R
| |-- hyperGtable.R
| |-- shortestPath.R
| |-- triad.R
| `-- zzz.R
[/code]

まず、すべてのクラス定義は R/AllClasses.R に含めることがわかります。また、すべての総称関数 (Generic function) の定義は、R/AllGenerics.R に含めます。総称関数のコードは、R/メソッド名-methods.R という名前にします。オブジェクトの変数にアクセスする、いわゆる accessor method は R/クラス名-accessors.R に集めます。

これらはこのようにしなければ動作しないというわけではありませんが、BioC ではこのような構造で実装することが推奨されています (Bioconductor パッケージガイドライン: S4 クラスとメソッドを参照)。

GOstats の場合もこの構造に則って実装されていますね。ファイル名をみると、hyperGTest-methods.R と GOHyperGResult-accessors.R があります。ファイル名から、このパッケージは、GOHyperGResult というクラスと、hyperGTest という総称関数を持っていることがわかります。

S4クラスの定義


では、実際にそのクラスどのように定義されているか見てみましょう。

AllClasses.R
[code]
setClass("GOHyperGResult",
contains="HyperGResultBase",
representation=representation(
goDag="graph",
pvalue.order="integer",
conditional="logical"),
prototype=prototype(
testName="GO",
pvalueCutoff=0.01,
goDag=new("graphNEL")))
[/code]

わずかこれだけです。setClass でクラスを定義します。このエントリを読むひとは S4 の知識がありそうなものですが、一応、setClass を簡単に説明しておきます。

representation メソッドはクラスの持つ変数を定義します。この変数を S4 では slot と呼びます。slot 名 = "データ型" のリストが引数になります。S4ではこのようにデータ型を指定し、インスタンスを作成したときに型が違うとエラーを出します。

prototype はインスタンスが作られたときに引数が与えられなかった場合にデフォルトで slot に代入される値を決めています。

S4 クラスの拡張


contains はスーパークラスを指定します。GOHyperGResult は HyperGResultBase クラスのサブクラスになります。つまり、HyperGResultBase で定義された slot をすべて引き継ぎます。では、HyperGResultBase はどこで定義されているのでしょうか。grep します。

[code]
pwd
/Users/itoshi/Projects/Rpacks-devel
grep HyperGResultBase */R/*
Category/R/AllClasses.R:setClass("HyperGResultBase",
:
:
[/code]
ありました。

Category/R/AllClasses.R
[code]
setClass("HyperGResultBase",
representation(annotation="character",
geneIds="ANY",
testName="character",
pvalueCutoff="numeric",
testDirection="character"),
contains="VIRTUAL",
prototype=prototype(pvalueCutoff=0.01))

[/code]

サブクラスである、HyperGResult は、で定義された slot である、geneIds, testName, pvalueCutoff, testDirection を持つことになります。

バーチャルクラス


HyperGResultBase の contains が VIRTUAL となっています。これは virtual class を定義する方法のひとつです。virtual class はインスタンスを作れないクラスのことです。このことから、HyperGResultBase が直接使われることはなく、subclass を定義して使うためにあること、HyperGResult 以外にも HyperGResultBase 以外のサブクラスがありそうなことが予想がつきます。

[code]
grep HyperGResultBase */R/*.R|grep contains
Category/R/AllClasses.R: contains="HyperGResultBase",
Category/R/AllClasses.R: contains="HyperGResultBase",
GOstats/R/AllClasses.R: contains="HyperGResultBase",
PCpheno/R/AllClasses.R: contains="HyperGResultBase",
eisa/R/AllClasses.R: contains=c("HyperGResultBase", "VIRTUAL"),
[/code]

PCpheno と eisa で使っているようです。

このようにバーチャルクラスとクラスの拡張を使うことで、ほとんど同じであるがわずかに representation が違うクラスを定義しているわけです。

まとめ


S4クラスや総称関数の定義をどこに置くのかをみました。また S4 でクラスを定義する方法とクラスを継承し拡張する方法を簡単に紹介しました。

次は、メソッドの定義を見ていきましょうかね。

続きます。

連載の目次


第1回: Bioconductor のパッケージについて知る
第2回: Bioconductor のソースコードを得る
第3回: Bioconductor には S4 で書かれたコードがどのぐらいあるのか
第4回: R package の構造

コメント

このブログの人気の投稿

シーケンスアダプタ配列除去ツールまとめ

FASTQ/A file からシーケンスアダプター配列やプライマー配列を除くためのプログラムをまとめてみる。 まず、配列の除去には大別して2つの方向性がある。ひとつは、アダプター配列を含む「リード」を除いてしまう方法。もうひとつは除きたい配列をリードからトリムする方法である。後者のほうが有効リードが増えるメリットが、綺麗に除ききれない場合は、ゲノムへのマップ率が下がる。 気をつける点としては、アダプター/プライマーの reverse complement を検索するかどうか。paired end の際には大事になる。クオリティでトリムできるものや、Paired-end を考慮するものなどもある。アダプター/プライマー配列の文字列を引数として直接入力するものと、multi fasta 形式で指定できるももある。 From Evernote: シーケンスアダプタ配列除去ツールまとめ TagDust http://genome.gsc.riken.jp/osc/english/software/src/nexalign-1.3.5.tgz http://bioinformatics.oxfordjournals.org/content/25/21/2839.full インストール: curl -O http://genome.gsc.riken.jp/osc/english/software/src/tagdust.tgztar zxvf tagdust.tgz cd tagdust/ make sudo make install rehash 使いかた: tagdust adapter.fasta input.fastq -fdr 0.05 -o output.clean.fastq -a output.artifactual.fastq 解説: 入出力形式は fastq/a が使える。リード全体を除く。速い。アダプター配列を fasta 形式で入力できるのが地味に便利で、これに対応しているものがなかなかない。Muth–Manber algorithm (Approximate multiple

ChIP-seq の Peak calling tool を集めたよ

ほかにもあったら教えてください。プログラム/プロジェクト名がツールのプロジェクトサイトへのリンク。その論文タイトルは論文へのリンクになっています。 ツール名の50音順です。 CCCT -  A signal–noise model for significance analysis of ChIP-seq with negative control , chipdiff と同じグループ CisGenome -  CisGenome: An integrated software system for analyzing ChIP-chip and ChIP-seq data . ChromSig -  ChromaSig: a probabilistic approach to finding common chromatin signatures in the human genome. ChIPDiff -  An HMM approach to genome-wide identification of differential histone modification sites from ChIP-seq data ChIP-Seq Analysis Server FindPeaks -  FindPeaks 3.1: a tool for identifying areas of enrichment from massively parallel short-read sequencing technology. Version 4.0 is out. GLITR -  Extracting transcription factor targets from ChIP-Seq data HPeak -  HPeak: an HMM-based algorithm for defining read-enriched regions in ChIP-Seq data MACS -  Model-based Analysis of ChIP-Seq (MACS). PeakSeq -  PeakSeq enables systematic scoring of ChIP-seq experimen

大学の研究室でアカデミックプランが使えるICTツール

自分らでサーバ管理したくないので、SaaS系とローカルで動くソフトのみ。ローカルで動くソフトに関しては、Mac or Docker で動くもののみ。 無償 G Suite for Education  (ドキュメント共有、カレンダーなど) GitHub Education  (ソースコード管理) esa.io アカデミックプラン  (知識共有) Tableau  (データ可視化) Scrapbox  (知識共有) GROWI.cloud  (Wikiなど) 割引 Slack の教育支援プログラム  (ビジネスチャット) Dropbox Education  (ファイル共有、ドキュメント共有) Office 356  (オフィスソフト) Adobe Creative Cloud  (画像編集) AutoDesk for Education  (CADなど) これから申し込んでいくところなので、本当に使えるかはわかりせん。使えた使えないなどの情報やほかのツールでお勧めがあれば教えてもらえると嬉しいです。 アカデミアでなくても無料で使えるツールのうち、うちで使うであろうものは以下に列挙していく。 Google Colaboratory  (データ解析) Overleaf  (論文執筆) Rstudio  (開発, データ解析) VS code (開発)