Single-Cell, Genome-wide Sequencing Identifies Clonal Somatic Copy-Number Variation in the Human Brain 这篇文章是讲单细胞CNV比较早的一篇。我都忘记为什么要看它了。

主要内容用半侧巨脑畸形和正常人的脑细胞,以及淋巴母细胞等细胞来做单细胞全基因组分析,看看扩增方法的噪声对CNV的影响。

单细胞扩增用的是MDA方法。还有一种单细胞处理方法是基于PCR的GenomePlex。

现有研究表明再神经细胞基因组中体细胞非整倍体比较罕见,但是体细胞CNV并不罕见。 文章中说明clonal somatic CNV在正常脑细胞和半侧巨脑畸形中都存在。 这个clonal somatic CNV的意思我不太明白,按文章的意思应该是一个细胞群体中都有的somatic CNV。

文章中有意思的一个地方是用microarray里的median absolute pairwise difference(MAPD)方法来比较拷贝数的噪声大小。 计算连续两个邻居bin上的log2 CN的绝对差异,并对所有bin取中位数,用这个数字代表噪声大小的分值。 计算结果说明MDA方法的噪声要比GenomePlex方法的大。

在后续研究中,他们只用MAPD<0.45的样本。单细胞采样会对测序结果产生较大影响,对单细胞低覆盖度的CNV分析可以用来评估样本质量。

样本之间的比较没什么有趣的东西,就不再赘述。

单词本

英文 中文 英文 中文
neuropsychiatric 神经精神 pathological 病理
euploid 整倍体 hemimegalencephaly(HMG) 半侧巨脑畸形
dysfunction 机能障碍 lymphoblast 淋巴母细胞
manifestation 表明,表示 prenatal 胎儿
malformation 畸形 defect 缺陷
epilepsy 癫痫 aneuploidy 非整倍体
tetrasomy 四体型,四倍体 magnitude 重要
compensate 补偿 fetus 胎儿
postmortem 死后 integrity 正直
intersample 采样 discrete 分离
integral 完整的 equivocal 模棱两可,意义不明
freeze-thaw 冷冻-融化 dicentric 双着丝粒
distal 末梢的 unperturbed 未扰动
query 质疑 bona fide 真实的
autism 孤独症 neuropsychiatric 神经精神疾病
nonetheless 但是,虽然如此 suspect 猜疑
intractable 难对付的 assay 测定

回顾一下看过的关于协同过滤,推荐系统的论文。

1.Application of Dimensionality Reduction in Recommender System – A Case Study

Knowledge Discovery in Databases(KDD) 中文是在已有数据中找寻知识的技术。

这个可以算是SVD方法做数据降维,协同过滤的一篇非常早的方法。看起来非常简单。

一般我们做推荐产品都是基于一个群体的,这个群体是个sub-group, 整个电商网站的用户会有很多,但是用户之间不一定都有很强的关系。 所以就需要寻找某个用户的邻近用户, 通过这些和他(她)很相似的邻近用户的一些行为来推测他(她)的行为(购买行为,喜欢购买的商品)。 邻居不一定是对称数量的,也就是A有5个邻居,而A的邻居B可能有20个邻居。

推荐系统做的最基本的两个事情:1.预测用户A对某个产品的喜爱程度;2.为用户A推荐一系列产品(用户A可能会购买的)。 在研究中遇到的主要问题:1.稀疏矩阵;2.大数据,计算慢;3.潜在同义词(商品)不好关联在一起。 关于稀疏矩阵在多说两句:有时Pearson nearest neighbor algorithm无法对某些用户推荐很多商品,这时因为存在reduced coverage问题。 如果相似度阈值取得较高,那么用户的邻居空间就会很小,所以在很小的邻居空间里可能就没有很多商品可以用来进行预测和推荐。

在这里本文作者用SVD方法主要解决了两个问题:1.找寻用户同产品间的潜在关系,使得我们可以计算某个用户对某个产品的喜爱程度。

  1. 降维,用低维空间代替高维“用户-产品”空间,在低维空间中计算邻居。

这个“用户-产品”矩阵\(R\)是\(i\)个用户对\(j\)个产品的打分。

为了预测,首先要对稀疏矩阵进行填充数值:就是把矩阵里的NA,填成相关的数值。 有两种方法:1.填充用户的打分平均值;2.填充商品的平均得分。试验结果表明用后者较好。 接下来要对数据进行标准化,也有两个可行方案:1.转换成\(z-score\);2.对于每个数值减去用户的平均值。试验结果表明用后者较好。

\[R_{norm}=R+NPR\]

其中NPR是个需要自己填充的矩阵,提供简单的非个性化推荐。

然后就进行矩阵分解得到低秩的近似矩阵:

  • 用SVD分解,获得\(U\),\(S\),\(V\)
  • 将\(S\)降维到\(k\)维
  • 计算\(S_{k}^{1/2}\),也就是\(S_{k}\)的平方根
  • 计算resultant matrices(结式矩阵):\(U_{k}S_{k}^{1/2}\)和\(S_{k}^{1/2}V_{k}^{'}\)

对于任意一个用户c以及产品p,可以得到预测的得分为:

\[C_{p_{pred}}=\bar{C}+U_{k}*\sqrt{S_k}^{'}*(c)*\sqrt{S_k}*V_{k}^{'}(P)\]

就写这么多,这篇文章后面有例子,一步一步写得很清楚,可以按照例子计算一次,基本方法就会了。

2.A Linear Ensemble of Individual and Blended Models for Music Rating Prediction 3.Novel Models and Ensemble Techniques to Discriminate Favorite Items from Unrated Ones for Personalized Music Recommendation

这2篇是KDD比较经典的一次比赛,内容就是协同过滤,预测用户对雅虎音乐的打分。做协同过滤最好都看看这篇文章,计算机和数学两方面写的都不错。 台大的多人小组差不多把能用上的方法都用了,人多力量大,这篇文章算是给大家讲解了各种方法解决这类问题的一个思路。

他们所用到的方法有(第一个task中):

  1. Matrix Factorization
  2. Restricted Boltzmann Machines
  3. kNN
  4. Probabilistic Latent Semantic Analysis
  5. Probabilistic PCA
  6. Supervised Regression

4.Hybrid Recommendation Models for Binary User Preference Prediction Problem 这篇还是KDD比赛的,比较了多种neighborhood-based model,latent factor model,content-based model加上SVD分解降维后的结果。 方法要比台大朴素,但效果也很不错。

另外之前说过的模型融合也是看了这几篇KDD文章来慢慢了解的。

5.Factorization Meets the Neighborhood: a Multifaceted Collaborative Filtering Model

这篇文章是在看文章4的时候提到的,主要就是看里面的公式(5) 潜在因子(latent factor)模型的公式。

recsyscode 里对文章中的模型有很好的代码实现。

单词本

英文 中文 英文 中文
unsubtle 咄咄逼人 depict 描绘
latent 潜在 semantic 语义
leverage 利用,运用,平衡 delineate 划定
sparsity 稀疏 alleviate 减轻缓和
retrieval 检索 syntactic 语法,句法
norm 范数 taxonomy 分类
blend 混合 stochastic 随机

最近要重读一批之前读过的文章,会大量更新笔记。

首先,我就又读了一遍Storey 和 Tibshirani 写的Statistical significance for genomewide studies。 纸质版被满篇标注了重点。在这里仅仅写一下两者的异同,推导请具体看文章附录。

文章是用q value度量FDR对p value 做校正。q value可以说是FDR的定量扩展。

FDR与false positive rate的区别

false positive rate 是符合零模型的特征被认为显著的比率。

FDR是显著的特征属于零模型的比率。

例如:false positive rate = 5% 意思是平均5%的零模型特征在研究中会被判别成显著的。 FDR=5%意思是在所有显著的特征中,平均存在5%的特征是真正属于零模型的。

familywise error rate

In statistics, familywise error rate (FWER) is the probability of making one or more false discoveries, or type I errors, among all the hypotheses when performing multiple hypotheses tests.

中文翻译成“总体错误推断率”比较好。

p value 与 q value

The p value is an individual measure of the false positive rate while the q value is an individual measurement of the false discovery rate.

比较重要的一点是,p value 如果完全响应零假设(不拒绝),那么p value的分布应该服从均匀分布。解释可以参考:http://stats.stackexchange.com/questions/10613/why-are-p-values-uniformly-distributed-under-the-null-hypothesis

q value <= 0.05产生160个表达量具有显著差异的基因,这意味着有大约8个(160*0.05)被称作具有显著差异的基因是假阳的。

对于p value和q value的普遍错误解释是,它们代表假阳性的概率。 例如,一个基因有q value = 0.013,这并不是说它有0.013的概率为假阳的, 0.013是说当我们认为这个基因是假设检验中的一个显著的结果时,而它是一个假阳性结果,这个事件发生的预计比率(期望比率)为0.013。

单词本

英文 中文 英文 中文
stricter 严格 surge 浪涌
underway 进行 in favor of 支持,有利于
hexamer 六聚体 dissection 解剖
haploid 单倍体 progeny 后代
legitimate 合法 obfuscate 混淆
intuitively 直观 intermediate 中间的
liberal 自由派,自由主义 rigorous 严格的
incurre 发生 concrete 实际,具体
exploiting 利用 conservative 保守
calibrate 较准 arbitrary 随意
implicit 隐含    

读了三篇PNNL某实验室的文章,PNNL感觉都是做蛋白质。 由于是初次接触蛋白质,所以有很多地方都理解的不好,这篇博客主要记录一下大致理解的地方。

Comprehensive Quantitative Analysis of Ovarian and Breast Cancer Tumor Peptidomes

这篇文章是定量分析肿瘤里的肽组学。由于对于肽链,小整体蛋白(多肽组学)经常被评估为不适合用于研究。

The study of the low molecular weight collection of bioreactive peptides, protein degradation products, and small intact proteins (i.e., peptidomics) is often criticized as being less sensitive, less reproducible, and as vulnerable to a lack of controls in sample collection and preparation

文章中用定量多肽组学平台和自己开发的分析工具研究了人类卵巢癌和乳腺癌异种移植的肿瘤样本中多肽进行研究。

1.bottom-up 1

Bottom-up(自下而上)是一种传统的手段,它将蛋白质的大片段混合物消化/酶解成小片段的肽后再进行分析,是在蛋白质组学的研究中较为广泛使用的一种质谱技术。然而由于选择性剪接、各种蛋白质修饰(例如乙酰化和甲基化)以及内源性蛋白质裂解等复杂机制的存在,使得细胞内产生了复杂的蛋白异构体及种类。Bottom-up无法完整准确地鉴定这些蛋白的特征。

2.Top-down 1

Top-down(自上而下)技术虽可以直接对完整的蛋白——包括翻译后修饰蛋白以及其它一些大片段蛋白测序,然而由于不能将完整蛋白质片段分离技术与串联质谱技术相整合而无法开展大规模的蛋白质组研究。

文章的研究做法有点像研究RNA,多肽分析也做得是热图,PCA,火山图等。

同时文章中也发现了个体间多肽的差异,要大于不同组织之间多肽的差异(这个结论在DNA层面也适用,RNA我没仔细做过数据不敢妄下结论)。 也就是聚类的时候每个个体的不同组织部位的数据会聚集到一起,个体和个体相距较远。

单词本

英文 中文 英文 中文
aberrant 异常 degradation 降解
mass spectrometric 质谱仪 xenograft 异种移植
postexcision 切除后 protease 蛋白酶
conventional 传统的、惯例的 proteolysis 蛋白水解
proteasomal 蛋白酶体 malignant 恶性的
metallopeptidase 金属肽酶 collagen 胶原蛋白
chromatography-tandem 色谱串联 serum 血清
plasme 血浆 invertebrate 无脊椎的
endogenous 内源 explicit 明确的、清楚的
repertoire 全部节目 ischemia 失血
anesthesia 麻醉 midline 中线
vertical 垂直 incision 切口
omentum 胃系膜 resect 切除
dissect 解剖 strip
specimen 标本 cryovials 冷冻
nitrogen 氮气 basal 基底
luminal 管腔 subcutaneously 皮下
cryopulverization 低温粉碎 isotopic 同位素
extracted ion chromatogram 萃取离子色谱法 elution 洗脱
intensity 强度 kinetics 动力学
perturbation 摄动 cold ischemia 冷缺血
concentration 浓度 precursor 前体
propensity 倾向 chymotrypsin 一种肽链内切酶,糜蛋白酶,胰凝乳蛋白酶
cytosolic 细胞溶质 proteolytic 蛋白水解

The utility of protein and mRNA correlation

文章一开头就说本文不在于竭尽可能的罗列前人的工作,而是指出什么样的实验能产生科学有用的结论。

正片一共就两页,首先说明了从1999年的一个关于mRNA和蛋白质的研究开始,大家发现了转录组表达水平和蛋白质组的含量没有一个很好的定量关系可以解释。 也就是转录组数据不能预测蛋白质组的水平。但是,RNA在蛋白质翻译中肯定起到了作用,例如:microRNA可以调控蛋白质合成。 mRNA和蛋白质得降解速率也大不相同(前者几分钟,后者几个小时甚至几年),并且对于同一个基因来说,其RNA和蛋白质的合成/降解速率也没有联系。 所以我们不能期望发现mRNA和蛋白质之间简单的相关性。

第二部分就是说如何整合多组学数据,产生深入的新发现。

随着各种技术的不断发展,多种数据整合是非常重要的。蛋白质可以用来监视磷酸化过程,转录组可以用来说明基因上下调时被哪些转录调控因子所调控。 蛋白质可以决定哪些转录本在哪个时间点可以翻译成蛋白质。整个过程是非常复杂的相互调控。 有研究发现,结肠癌CNA的变化通过反式作用来影响多种蛋白质。这个工作建立起了突变(CNV)同表型的关系。

最后作者表达了我们需要的是真正的整合组学研究的观念模式,而不仅仅是相关性研究(see Box 1)。

Box 1. Outstanding questions

  • What is data integration beyond correlation?
  • How do we educate new scientists to appreciate the diversity of -omics measurements?
  • How to determine which -omic data type is best to investigate a hypothesis?
  • When to generate multi-omic data?

单词本

英文 中文 英文 中文
nuanced 细微差别 disruptive 破坏性
interrogation 审讯 elucidate 阐明
succinctly 简洁的 pervasive 普遍
oscillation 振荡 orthogonally 互不相关
utilitarian 功利 perspective 角度
phosphorylation 磷酸化 delineating 描述
cognate 同源 myriad 无数
paradigm 范式 mindeset 观念模式,思维倾向

Analytical platform evaluation for quantification of ERG in prostate cancer using protein and mRNA detection methods

这篇文章是实验检测技术。用PRISM-SRM质谱(不需要抗体)方法来检测前列腺癌症中的ERG蛋白,这种蛋白由于基因融合导致变化,是一个癌基因(原癌)蛋白。

文章的摘要部分已经把内容讲得很清晰了:本文主旨就是找寻新的前列腺癌症检测靶标以及检测方法。在细胞、组织和直肠指诊尿液沉积物中做实验, 用ELISA, western blog, NanoString和qRT-PCR分别检测蛋白和RNA含量。 结果就是不管是检测ERG转录本产物还是蛋白质产物,在临床诊断和预后分析中都有价值。

单词本

英文 中文 英文 中文
prostate 前列腺 post-DRE 直肠指诊
sediment 沉积物 immunosorbent 免疫吸附
lysate 裂解液 prognostic assays 预后分析
androgen 雄激素 Ewing’s sarcoma 尤文氏肉瘤
indolent 缓慢 impetus 动力
epitope 抗原决定部位 immunohistochemistry 免疫组织化学
serologic 血清学 assay 试验
hemocytometer 细胞计数器 ailquote 整除
titrate 滴定 stroma 基质
spurre 鞭策 biopsies 组织活检
Caucasian 高加索人,白种人 endothelial 内皮
devoid 缺乏 mimic,mimicking 模仿

参考资料


由于断网没法工作,有时间看了去年上映的《小王子》电影动画。

记得厄休拉·勒奎恩(Ursula Le Guin)看了宮﨑吾朗制作的动画电影《地海传奇》时评价The moral sense of the books becomes confused in the film 来表达对电影改编的不满。

我看了小王子后,也想说,这是一个套着《小王子》原著外皮的改变故事,导演和编剧在故事里想融入:对成人社会中一些迂腐行为的鄙视;对于家长为了培养小孩成为精英而导致孩子学业繁重没有童年的批评;对于亲情友情的重新审视;从女孩子的视角看这个世界。

我只想说,上面随便一点,有个好的思路都能作出一部好动画作品,可惜都揉杂在一起,还非要贴小王子的故事,讲得一点都没有意思。 总之,电影后半段找长大的小王子开始,一点都不值得一看。小王子故事里的精髓在动画中一点都没有显现出来。