摘要:大数据促进了司法证明方式的革新。相较于传统证明,大数据证明具有超越人类主观经验的智能化特征,并从物理空间转向数据空间,从侧重逻辑的因果关系转向侧重数理的因果关系,从面向过去的证明转向涵摄未来的证明。数据、算法及法律程序是影响大数据证明可靠性的主要因素,具体表现为数据法律层面的错误及样本不全面,算法模型不准确及不公正,法律程序不透明。对此,可构建基于数据规则的可靠性审查机制。数据层面,应加强法律数据真实性判断,保证数据的全样本。算法准确性层面,引入算法同行评议机制,保障算法适用情景的匹配性;算法公正性层面,选择多元化数据集、识别替代性变量以及审查模型偏见。法律程序层面,建立算法开示程序、大数据证明结果排除规则以及专家辅助人出庭等制度。
关键词:大数据;司法证明;算法偏见;算法开示
作者 | 王燃(法学博士,天津大学法学院副教授,天津大学中国智慧法治研究院研究员)
来源 |《法学家》2022年第3期“专论”栏目。
因篇幅较长,已略去原文注释。
引言
随着大数据、人工智能技术逐渐渗入司法证明领域,引起建立在大数据基础上、以算法为核心的证明方式变革。大数据在司法领域的证明作用,突出表现在以下几方面:(1)证明主体身份。基于海量数据的生物特征识别技术开始用于人身同一性认定,例如混合DNA识别模式在美国司法界已日趋成熟。基于人脸数据、指纹数据甚至是步态数据的算法模型,大大拓展了人身同一认定的范围。(2)证明资金账户特征。近年来,我国公安经侦部门开始借助大数据技术,应对互联网金融犯罪海量数据的审查认定难题,犯罪组织成员间关系、传销账号及层级、资金流向等特征在算法模型下一目了然。(3)证明情节轻重、损害程度等。根据我国相关司法解释,网络犯罪中“视频或音频文件个数”“点击数”“注册会员数”“浏览量”“转发量”等“海量数据”往往作为判断情节严重的依据。面对动辄成千上万的数量级,实务中多以软件(借助算法模型)自动统计。此外,“大数据指数”也经常用于知识产权等案件中损害程度的证明,例如百度指数等证明对象的热度、知名度、影响力等。(4)证明人身危险。在美国,司法领域开始普遍采用算法评估嫌疑人的人身危险性、再犯可能性,并将之作为假释和量刑的依据。
相较于实务界大数据证明运用的蓬勃景象,学界的大数据证明研究尚不多,且主要集中于对其证据形式、真实性及关联性的分析讨论。上述研究也有很多观点值得进一步深化。首先,大部分研究侧重于“大数据证据”,且过多拘泥于讨论其证据形式,忽视其背后证明方法的运用。虽然有大数据证明研究,但并未厘清其证明机理以及与传统证明的差异,相关参考案例也较少。其次,目前研究对数据真实性讨论较多,但往往将其混淆为电子数据真实性,或者仅从技术层面探讨数据真实,而对法律层面的数据真实关照较少。再者,目前研究都关注“算法黑箱”“算法偏见”问题,并提出算法开示等配套制度。然而,除了技术性“算法黑箱”外,还有人为的“程序黑箱”;“算法偏见”在不同的社会背景下表现也不尽一致,应重点探究偏见背后的普适性原因;“算法开示”也要针对不同司法证明场景构建具体的程序性规则。本文将在中外大数据证明实务运用基础上,归纳大数据证明相较于传统证明的特征,着重分析其可靠性问题并提出相应的规制路径。
一、大数据证明的机理
有学者从狭义角度出发,认为大数据证明的关键在于计算模型的构建,即通过算法所产生的数据结果;有学者则从广义角度出发,将一些数据库平台查询搜索结果、海量数据本身也纳入其中。本文认为,相较于传统基于人类经验的证明机理,大数据证明的核心在于以算法模型完成证明过程,是一种超越人类经验的智能化证明。
传统司法证明,无论是证据证明,抑或是推理、司法认知,都是基于人类主观经验的证明。(1)司法证明主要借助证据与证据、证据与事实之间的逻辑关联,将事实碎片拼接成完整事实图画。证据推理的关键环节,即“大前提”一般都是来源于主观经验。(2)除了证据证明外,推定、司法认知这两种证明方式中主观经验更为重要。推定强调从基础事实到推定事实之间要具有高度的伴生关系,事物间的伴生关系来源于主观经验。司法认知中显而易见的事实、众所周知的事实等也建立在主观经验基础上。此外,传统证明以物理空间为场域,相对来说证据数量有限,证据中所体现的信息也较为有限。从证据到事实的推理过程,基本上依靠经验即可完成。
大数据证明则是依靠智能化算法来完成证明活动,是一种超越了人类经验的新型证明模式。一方面,大数据证明解决了人类经验难以完成的证明困境。大数据时代出现了证明对象海量化的趋势,特别是在一些互联网涉众案件中,提取的电子数据动辄上亿条。对此,仅凭人类经验浏览完数据集都是不可能完成的任务,更遑论进行证据推理。这种情况下,算法提供了一种超越人类经验的智能化证明方法。算法可将证明难题模型化,提炼出类案中的普遍证明规律与特征,用数学模型来取代主观推理。我国司法实践中已研发出不少互联网金融案件算法证明模型,例如我国司法实践中已研发出不少互联网金融案件算法证明模型,其证明机理由此可窥见一斑:(1)集资诈骗型:若海量资金账户链路指向某一个账户,基本可以判断该账户为“吸款”账户,属于集资、诈骗型犯罪。(2)税票虚开型:若资金流向呈现“闭环”模型,即资金在多个账户之间流转后,又回到最初的账户,基本可以判断为(税票)“虚开”的事实。(3)传销类犯罪:资金分散转入账户,但集中转出;资金交易具有一定周期性;资金链呈现“金字塔”形。互联网金融犯罪中,犯罪组织成员间关系、传销账号及层级、资金流向等关键事实在算法模型下一目了然,而这些都是传统经验式证明根本无法完成的任务。
另一方面,大数据证明突破了人类经验尚未涉足的认知新领域。超越人类经验的智能化算法亦可被用来探索司法证明的新领域。近年来,DNA领域的证明“空白”由此得以突破。在单一DNA来源的案件中,一直以“人类翻译”(human interpretation)为主导方法。但面对混合DNA——即在同一生物证据中存在两个人或更多人DNA混合物,人类经验则束手无策。在美国,以TrueAllele为代表的技术公司,通过专业的算法模型对混合DNA中的海量数据分析,进行人身同一认定,并由此确定刑事案件真凶。早在2009年的联邦诉福利一案中(Commonwealth v. Foley),法院便采信了TrueAllele分析结果。目前,以TrueAllele为代表的混合DNA分析算法已在美国司法实务中得到广泛应用。
可见,大数据证明能够弥补传统经验式司法证明的短板,大大拓展了人类证明的领域边界,是一种超越人类经验的证明模式。相较于传统证明,大数据证明还具有数据空间证明、数据因果关系证明以及涵摄未来证明等内涵。
(一)从侧重于物理空间的证明到侧重于数据空间的证明
传统证明主要以物理空间为场景。这里的“物理空间”既包括肉眼可见、可以直观感知的现实场景,亦包括以新兴电子数据为代表的“虚拟空间”。本质上来说,“虚拟空间”亦属于广义上的物理空间,其体现为0和1二进制代码所组成的空间。在物理空间场景,证据表现为证据载体以及根据载体所反映出的信息,主要根据载体所反映的信息进行事实证明。以人身同一认定为例,传统证明可通过辨认来确定犯罪嫌疑人或被害人,其原理是犯罪嫌疑人或被害人在辨认主体脑海中留下的特征映像。传统辨认的效果取决于辨认主体的认知、记忆能力,以及特征反映体是否具有典型性等,受限于物理空间的条件限制。
大数据证明则以数据空间为场景。这里的“数据空间”不同于传统证明中所“自然”生成的物理空间,而是源于大数据时代的“万物皆可数据化”特征,探求物理空间中一切事物所对应的数据形态。理论上说,八种法定证据种类,均可映射在数据空间,有着相对应的数据化形态。大数据证明亦是“物数据化”的过程,将原本物理空间证明转移至数据空间,寻求基于数据及算法的证明方法。仍以人身同一认定为例,大数据证明可采用人脸识别技术来完成证明。其原理是将物理空间具像的人脸转化为图像数据,计算人脸特征的相关数值,再通过数据比对等算法来进行智能化识别。可见,大数据证明不同于物理空间“载体—信息”式证明方式,其将证明对象转化为数据,并通过数据的智能化计算分析来完成证明。
(二)从侧重逻辑推理的因果关系到侧重基于数理的因果关系
传统证明侧重基于逻辑的因果关系。因果关系是人类认识世界的根本方式。在司法证明中,因果关系的理解及运用尤为重要,往往表现为从果溯因式的逻辑推理。例如张三在案发后神情紧张(果),假设作案人在案发后神情紧张,那么张三则有可能是该案件的作案人(因)。传统司法证明中的因果关系通过人脑的逻辑推理来完成。人脑在接受证据信息后,探究证据背后的原因,建立起证据与事实之间的因果关系,以及证据与证据之间的因果关系。
大数据证明侧重基于数理的因果关系。很多学者有这样的误解,认为大数据擅长相关关系而非因果关系,大数据证明中知道“是什么”就足够了。但实际上并非如此。相关关系实际上是因果关系的派生。数据空间中,物数据化意味着因果关系的数据化,因果关系被蜕化为变量之间的数理关系。数理关系完全不同于人类的推理逻辑,其主要表现为数据之间的相关性,并往往进一步体现为“概率”。同理,大数据证明中,因果关系并非不存在、不重要,而是体现为数据的相关关系。甚至一些案件中,司法人员已经开始通过寻求变量之间的强相关关系,进而来证明因果关系。例如在埃里卡·P.约翰基金公司诉哈里伯顿公司案中(Erica P. John Fund Inc.v. Halliburton Co.),其核心争议点就在于原告能否证明被告哈里伯顿公司的错误声明影响了公司的股价,并由此导致投资者受损。对此,原告方采取了“事件学习”(Event Study)的数据分析方法,证明了被告公司的财务隐瞒行为与股民投资行为之间具有因果关系。在迈阿密诉美国银行案中(Miami v. Bank of America),原告方通过算法证明了被告美国银行的贷款政策导致了差别化对待,种族因素在其贷款发放中占有重要比重。此案一直上诉到最高法院,最高法院又将案件发回第十一巡回法庭重审,并要求确定美国银行的政策与原告所称的种族歧视之间是否有直接关系(Direct Relation);2019年5月,第十一巡回法庭确认“直接关系”的存在,并进而证明了被告的贷款政策与歧视化、差别化对待之间存在因果关系。可见,大数据证明中,因果关系并没有被抛弃,只不过传统基于逻辑推理的因果关系往往以数理相关关系表现出来,甚至很多案件中借助大数据分析来解决因果证明的难题。
(三)从面向过去的证明到涵摄未来的证明
传统证明主要面向过去事实。大数据时代之前,人类活动主要是描述性的,即真实、精确地反映既存对象,以真实性为衡量标准。描述性活动亦表现在司法证明中,传统司法证明对象是“事实”。一般认为,诉讼活动中需要证明的案件事实都是已经发生的历史事实。
大数据证明可涵摄未来事项。预测是大数据最具价值的应用。大数据时代人类活动转向创构性,即根据人的需要和发展进行开创性活动,以使用的有效性为衡量标准。创构性活动主要建立在大数据预测基础上,通过对相关因素的把握和干预,来达到预想的结果。创构性活动亦对司法领域产生影响。特别是随着风险社会、信息社会带来的风险增加,预测警务、预测侦查在全球范围兴起,通过对犯罪分子、犯罪地区、受害人等预测,来提前防范社会风险。预测警务离不开证明活动,随之而来的司法证明也开始逐渐涵摄未来事项。例如芝加哥警方探索基于证据的警务模式(evidence-based policing),利用算法、基于11个加权变量来识别高危人群,筛选出高危分子,并对其进行1—500赋分,分数越高,说明其越有可能参加暴力活动。
此外,从广义上来说,即便是传统的司法证明也有面向未来的因素,但在大数据时代之前表现得尚不明显。传统司法证明对象包括影响量刑、羁押、取保候审、监视居住等程序性措施的要件,典型的如嫌疑人“人身危险性”“再犯可能性”的证明。我国认罪认罚从宽制度中,可能判处管制、宣告缓刑亦要进行社会调查评估,对被告人的家庭和社会关系、一贯表现、犯罪行为的后果和影响等进行调查评估。大数据无疑为“人身危险性”“再犯可能性”的评估和预测提供了绝佳的工具。在美国,司法机关已普遍采用算法评估嫌疑人的人身危险性、再犯可能性,并将之作为假释和量刑的依据。人身危险性评估模型一般将当事人的人身背景及其历史犯罪等数据作为评价要素,预测其未来的犯罪风险。例如公共安全评估系统(Public Safety Assessment,PSA)在搜集美国300个辖区的75万项案例数据基础上,根据嫌疑人年龄、未决指控、未出庭记录等九项指标来计算能否保释该犯罪嫌疑人。再如COMPAS(Correctional Offender Management Profiling for Alternative Sanctions)系统根据嫌疑人的社交关系、生活方式、个性、家庭等动态因素去评估其再犯可能性,并作为法官量刑的依据。
二、大数据证明的可靠性风险
作为一种新型证明方式,证明结果可靠与否乃大数据证明首先要面对的问题。不同于传统基于人类主观经验的证明方式,大数据证明本质在于机器自主、智能化分析。而在这一证明机理中,起关键作用的要素即数据和算法。因而,大数据证明的可靠与否主要取决于基础数据的真实性与全面性,以及算法模型的准确性与公平性,相关法律程序的缺失亦会对其可靠性产生影响。
(一)数据维度
数据质量及其真实性是大数据证明可靠与否的基础。大部分研究都认为数据源本身要准确,有学者还提出“宏观真实性”及“微观真实性”的观点。然而,上述分析仍然停留在技术层面。实践中,还存在如数据虚假等“法律”层面数据不真实,以及数据样本不全面等问题。
1.法律层面的数据错误
原始数据一般都面临混杂性问题,包括格式不统一、数据重复、残缺、错误等。对于共性的数据混杂问题,可以通过数据清洗、数据转换等技术来解决。然而,司法证明中的数据混杂远不止技术层面。法律评价与技术评价的差异导致了虚拟空间的“数据”往往不能对应至背后的法律行为,技术真实的数据不一定法律真实,并进而导致法律事实认定困难。例如“点击数”“转发数”“浏览次数”“注册用户数”等海量数据型证据,每一次计数都来源于软件的自动统计,但这些机器计量数据并不一定就对应着具有法律实质意义的行为。某些网站的高点击数可能是水军“刷单”,注册的账号可能是“僵尸用户”,此外还有一人点击多次、网络黑客攻击、机器故障等情形。例如“邱成林、胡望、林春传播淫秽物品牟利案”中,涉案网站点击量5595957次系通过“CNZZ数据专家”软件统计得出,然而法官认为统计数是整个网站的被点击数,不等同于淫秽电子信息的“实际被点击数”,应当扣除非淫秽电子信息的点击数和无效点击的数量、自点击数等。在美国,网络广告欺诈司法实务中也突显此类问题。如有些网红采取诸如“僵尸粉”、机器刷流量等方式去扩大自己的粉丝量,以非法获取高额广告利润。诉讼中,如何区分真实账户与虚假账户、真实数据与虚假数据成为亟待解决的司法难题。
|