字面计数太脆
同义词、近义词和语境变化会让简单关键词计数失真。
把文本变量转成可进入实证模型的工具变量信号。
TexIV 是一个 Python 与 Stata 工具包,用中文分词、文本 embedding、相似度计算和两阶段过滤,把年报、政府报告、访谈材料等非结构化文本转成 frequency、count、rate 等可复现指标。

同义词、近义词和语境变化会让简单关键词计数失真。
大规模文本样本需要可重复、可调参、可审计的自动化流程。
研究者常在 Python 与 Stata 之间来回搬数据,容易引入手工错误。
流程不是黑箱展示,而是面向实证研究者的可解释处理链:每一步都能被配置、复查和复现。
把年报、政府工作报告、访谈文本或企业描述作为原始文本变量输入。
使用中文分词、停用词和可配置规则,把长文本拆成可比较的语义片段。
用 OpenAI、Ollama 等 embedding 后端,把文本片段和研究关键词映射到同一个向量空间。
通过相似度和两阶段过滤,输出 frequency、count、rate 等可进入实证模型的指标。
TexIV 不要求研究者放弃原来的工作流。你可以先在 Python 中调试方法,再把成熟流程接到 Stata 数据集里批量运行。
pip install texiv
from texiv import TexIV
texiv = TexIV()
result = texiv.texiv_it(
"This is a test text...",
["keyword1", "keyword2", "keyword3"],
)
# {'freq': 7, 'count': 34, 'rate': 0.2059}. github install SepineTam/TexIV
. texiv report, kws("政府 数字化 经济发展 互联网 物联网")这页会围绕 “text instrumental variables”“Stata text analysis”“machine learning econometrics” 等检索意图组织内容,同时避免夸张承诺。
TexIV 是一个面向实证研究的开源工具,它用机器学习方法把文本变量转成数值指标,尤其适合需要从中文文本中构造主题强度、关键词相关度或工具变量代理指标的研究。
普通关键词计数只看字面出现次数;TexIV 会先做分词和向量化,再根据关键词与文本片段的语义相似度进行过滤,因此更适合处理同义表达、近义表达和长文本中的主题强度。
支持。项目提供 Stata ado 接口,研究者可以在 Stata 中对字符串变量运行 texiv 命令,并在数据集中得到频次、总量和比例等新变量。
TexIV 需要 Python 3.11+。如果在 Stata 中使用,推荐 Stata 17+,并需要配置好 Stata 调用的 Python 环境。