Open-source econometrics toolkit

TexIV

把文本变量转成可进入实证模型的工具变量信号。

TexIV 是一个 Python 与 Stata 工具包,用中文分词、文本 embedding、相似度计算和两阶段过滤,把年报、政府报告、访谈材料等非结构化文本转成 frequency、count、rate 等可复现指标。

TexIV logo and project wordmark
Python
3.11+
Stata
17+
Release
0.1.10
Research Problem

文本变量很丰富,但很难直接进入回归。

字面计数太脆

同义词、近义词和语境变化会让简单关键词计数失真。

人工编码太慢

大规模文本样本需要可重复、可调参、可审计的自动化流程。

跨工具太麻烦

研究者常在 Python 与 Stata 之间来回搬数据,容易引入手工错误。

How TexIV Works

从文本到 IV 指标的四步流水线

流程不是黑箱展示,而是面向实证研究者的可解释处理链:每一步都能被配置、复查和复现。

01

Text field

把年报、政府工作报告、访谈文本或企业描述作为原始文本变量输入。

02

Segmentation

使用中文分词、停用词和可配置规则,把长文本拆成可比较的语义片段。

03

Embedding

用 OpenAI、Ollama 等 embedding 后端,把文本片段和研究关键词映射到同一个向量空间。

04

IV signal

通过相似度和两阶段过滤,输出 frequency、count、rate 等可进入实证模型的指标。

Use It Where You Work

Python、命令行、Stata 都能用。

TexIV 不要求研究者放弃原来的工作流。你可以先在 Python 中调试方法,再把成熟流程接到 Stata 数据集里批量运行。

从城市政府工作报告中构造数字经济、产业升级、人工智能等主题强度指标。
把企业文本披露转成可复现的关键词相关度变量,用于面板回归或工具变量设计。
在 Stata 数据集中直接生成 texiv_freq、texiv_count、texiv_rate,减少 Python 和 Stata 间的手工搬运。
pip install texiv

from texiv import TexIV

texiv = TexIV()
result = texiv.texiv_it(
    "This is a test text...",
    ["keyword1", "keyword2", "keyword3"],
)

# {'freq': 7, 'count': 34, 'rate': 0.2059}
. github install SepineTam/TexIV
. texiv report, kws("政府 数字化 经济发展 互联网 物联网")
SEO-friendly Facts

给搜索引擎,也给研究者的清晰答案。

这页会围绕 “text instrumental variables”“Stata text analysis”“machine learning econometrics” 等检索意图组织内容,同时避免夸张承诺。

Package
Python package with CLI entry point
Stata
ado interface for Stata workflows
Methods
segmentation, embeddings, similarity filtering
Outputs
frequency, count, ratio statistics
License
AGPL-3.0 in repository README
Repository
SepineTam/TexIV on GitHub
FAQ

关于 TexIV 的常见问题

TexIV 是什么?

TexIV 是一个面向实证研究的开源工具,它用机器学习方法把文本变量转成数值指标,尤其适合需要从中文文本中构造主题强度、关键词相关度或工具变量代理指标的研究。

TexIV 和普通关键词计数有什么区别?

普通关键词计数只看字面出现次数;TexIV 会先做分词和向量化,再根据关键词与文本片段的语义相似度进行过滤,因此更适合处理同义表达、近义表达和长文本中的主题强度。

TexIV 支持 Stata 吗?

支持。项目提供 Stata ado 接口,研究者可以在 Stata 中对字符串变量运行 texiv 命令,并在数据集中得到频次、总量和比例等新变量。

使用 TexIV 需要什么环境?

TexIV 需要 Python 3.11+。如果在 Stata 中使用,推荐 Stata 17+,并需要配置好 Stata 调用的 Python 环境。

把文本变量放回实证研究现场。

从 GitHub 开始查看示例,或阅读项目 Wiki,把 TexIV 接入你的 Python、Stata 和论文复现流程。

返回 AIdeaLabs 首页