
上个月朋友老陈找我帮忙。他在一家连锁餐饮企业做采购主管,公司最近集中签供应商合同,两百多份堆在桌上,等着他一份一份审。
我到他办公室的时候,他正戴着眼镜,拿着荧光笔在纸质合同上划线。每份合同他要看付款条件、违约责任、知识产权归属这些关键条款,然后在Excel里填一行审核记录。一份合同快的话十五分钟,慢的话半小时。
“我这周每天加班到九点,眼睛都花了。”老陈把荧光笔往桌上一扔,“而且人工审容易漏,上周就有一份合同把违约金比例写成了0.5%,他没看出来,差点出问题。”
两百多份合同,格式大同小异,关键条款就那么几个维度。这不就是让AI干的活嘛。
思路很直接:把合同文本丢给大模型,让它提取关键条款,同时标注潜在风险点。用pandas做批量处理,结果导出Excel,跟老陈原来的工作习惯对接。模型我用的是DeepSeek,长文本处理能力强,合同丢进去不会截断。
关键是要让模型返回JSON,后面处理起来方便。
先装依赖:
pip install requests pandas openpyxl完整代码:
import requests
import json
import pandas as pd
import time
import os
from datetime import datetime
# ============ 配置区域 ============
API_KEY = "sk-your-deepseek-api-key" # 替换成你的API Key
API_URL = "https://api.deepseek.com/chat/completions"
# 要提取和审核的关键维度
REVIEW_PROMPT = """你是一个资深法务助理,请审核以下合同文本,提取关键条款并标注风险点。
请按以下JSON格式返回(不要输出其他内容):
{
"contract_parties": "合同双方名称",
"contract_type": "合同类型(采购/服务/租赁/其他)",
"contract_amount": "合同金额(如有)",
"payment_terms": "付款条件摘要",
"delivery_terms": "交付/履约条件摘要",
"liability_clause": "违约责任条款摘要",
"termination_clause": "合同终止/解除条件摘要",
"ip_ownership": "知识产权归属(如有)",
"dispute_resolution": "争议解决方式",
"contract_period": "合同期限",
"risk_items": [
{
"description": "风险描述",
"severity": "高/中/低",
"suggestion": "修改建议"
}
],
"overall_risk_level": "高/中/低",
"summary": "一句话总结该合同的核心风险"
}
审核要点:
1. 付款条件是否对我方不利(如预付比例过高)
2. 违约金是否合理(通常不超过合同金额的30%)
3. 是否存在单方面解除权不对等
4. 知识产权归属是否明确
5. 争议解决方式是否对我方不利(如对方所在地仲裁)
6. 合同期限和续约条件是否合理
合同文本:
"""
def review_single_contract(contract_text, contract_name=""):
"""
审核单份合同
参数:
contract_text: 合同全文文本
contract_name: 合同文件名(用于日志)
返回:
解析后的JSON结果字典
"""
headers = {
"Content-Type": "application/json",
"Authorization": f"Bearer {API_KEY}"
}
# 系统提示词,约束输出格式
system_msg = "你是专业的合同审核助理,严格按照要求的JSON格式输出,不要输出任何多余内容。"
payload = {
"model": "deepseek-chat",
"messages": [
{"role": "system", "content": system_msg},
{"role": "user", "content": REVIEW_PROMPT+contract_text}
],
"temperature": 0.1, # 温度调低,合同审核需要稳定准确
"max_tokens": 2000
}
try:
response = requests.post(API_URL, headers=headers, json=payload, timeout=120)
response.raise_for_status()
result = response.json()
# 提取AI回复内容
content = result["choices"][0]["message"]["content"]
# 尝试解析JSON,处理可能的markdown代码块包裹
content = content.strip()
ifcontent.startswith("```"):
# 去掉 ```json ... ``` 的包裹
content = content.split("```")[1]
ifcontent.startswith("json"):
content = content[4:]
content = content.strip()
review_result = json.loads(content)
return review_result
except json.JSONDecodeError:
print(f" [警告] {contract_name} 的返回结果不是有效JSON,尝试修复...")
# 简单的修复:尝试提取第一个 { 到最后一个 } 之间的内容
start = content.find("{")
end = content.rfind("}") +1
if start!= -1 and end>start:
try:
return json.loads(content[start:end])
except json.JSONDecodeError:
pass
return {"error": "JSON解析失败", "raw_response": content}
except Exception as e:
print(f" [错误] 审核 {contract_name} 时出错:{e}")
return {"error": str(e)}
def batch_review_contracts(input_dir="./contracts"):
"""
批量审核目录下的所有合同文件
参数:
input_dir: 合同文本文件存放目录
返回:
DataFrame格式的审核结果
"""
# 收集所有txt文件
contract_files = [f for f in os.listdir(input_dir) if f.endswith(".txt")]
print(f"发现 {len(contract_files)} 份合同文件")
all_results = []
for i, filename in enumerate(contract_files, 1):
filepath = os.path.join(input_dir, filename)
print(f"[{i}/{len(contract_files)}] 正在审核:{filename} ...", end=" ")
# 读取合同文本
with open(filepath, "r", encoding="utf-8") as f:
contract_text = f.read()
# 调用AI审核
result = review_single_contract(contract_text, contract_name=filename)
print("完成")
# 整理结果
risk_items = result.get("risk_items", [])
high_risks = [r for r in risk_items if r.get("severity") == "高"]
medium_risks = [r for r in risk_items if r.get("severity") == "中"]
row = {
"文件名": filename,
"合同双方": result.get("contract_parties", ""),
"合同类型": result.get("contract_type", ""),
"合同金额": result.get("contract_amount", ""),
"付款条件": result.get("payment_terms", ""),
"违约责任": result.get("liability_clause", ""),
"争议解决": result.get("dispute_resolution", ""),
"合同期限": result.get("contract_period", ""),
"整体风险等级": result.get("overall_risk_level", ""),
"高风险项数量": len(high_risks),
"中风险项数量": len(medium_risks),
"风险详情": "; ".join([
f"[{r.get('severity','')}] {r.get('description','')}"
for r in risk_items
]),
"修改建议": "; ".join([
r.get("suggestion", "")
for r in risk_items if r.get("severity") in ("高", "中")
]),
"总结": result.get("summary", ""),
"审核时间": datetime.now().strftime("%Y-%m-%d %H:%M:%S")
}
all_results.append(row)
# API调用间隔,避免触发限流
time.sleep(1)
# 转成DataFrame
df = pd.DataFrame(all_results)
return df
def export_to_excel(df, output_path="./contract_review_results.xlsx"):
"""
将审核结果导出为格式化的Excel文件
"""
with pd.ExcelWriter(output_path, engine="openpyxl") as writer:
df.to_excel(writer, sheet_name="审核结果", index=False)
# 调整列宽
worksheet = writer.sheets["审核结果"]
column_widths = {
"A": 20, "B": 25, "C": 10, "D": 15,
"E": 30, "F": 30, "G": 20, "H": 15,
"I": 12, "J": 12, "K": 12, "L": 50,
"M": 50, "N": 40, "O": 18
}
for col, width in column_widths.items():
worksheet.column_dimensions[col].width = width
print(f"\n审核结果已导出到:{output_path}")
def print_summary(df):
"""打印审核概览"""
print("\n"+"="*50)
print("合同审核概览")
print("="*50)
print(f"合同总数:{len(df)}")
risk_counts = df["整体风险等级"].value_counts()
for level in ["高", "中", "低"]:
count = risk_counts.get(level, 0)
print(f" {level}风险:{count} 份")
# 列出高风险合同
high_risk = df[df["整体风险等级"] == "高"]
if len(high_risk) >0:
print(f"\n高风险合同清单({len(high_risk)} 份):")
for _, rowinhigh_risk.iterrows():
print(f" - {row['文件名']}:{row['总结']}")
# ============ 主流程 ============
if __name__ == "__main__":
contracts_dir = "./contracts"
# 如果目录不存在,创建并放几个示例合同进去
if not os.path.exists(contracts_dir):
os.makedirs(contracts_dir)
sample1 = """供应商采购合同
合同编号:CG-2024-0156
甲方:北京美味连锁餐饮有限公司
乙方:上海绿源食品供应有限公司
第一条 采购标的
甲方向乙方采购冷冻蔬菜系列产品,具体品种和规格详见附件《产品清单》。
第二条 合同金额
本合同总金额为人民币壹佰贰拾万元整(¥1,200,000.00)。
第三条 付款条件
甲方应在合同签订后3个工作日内预付合同总额的50%作为定金,即人民币陆拾万元整。
剩余50%在最后一批货物验收合格后7个工作日内支付。
第四条 交付条件
乙方应在合同签订后30天内分三批完成全部货物的交付。
交货地点为甲方指定的中央厨房仓库(北京市大兴区XX路XX号)。
第五条 违约责任
若乙方延期交货,每延期一天,应支付合同总额0.5%的违约金。
若甲方延期付款,每延期一天,应支付未付款项0.5%的违约金。
违约金累计上限为合同总额的15%。
第六条 争议解决
因本合同引起的争议,双方应友好协商。协商不成的,提交上海仲裁委员会仲裁。
第七条 合同期限
本合同自双方签字盖章之日起生效,有效期至2025年6月30日。
合同到期前30天,如双方均未提出终止,合同自动续期一年。"""
sample2 = """设备租赁合同
合同编号:ZL-2024-0089
出租方(甲方):深圳智厨设备科技有限公司
承租方(乙方):北京美味连锁餐饮有限公司
第一条 租赁标的
甲方将以下厨房设备租赁给乙方使用:
- 商用烤箱 x5台
- 商用冰箱 x10台
- 自动洗碗机 x3台
第二条 租金及支付
月租金为人民币叁万伍仟元整(¥35,000.00)。
乙方应在每月5日前支付当月租金。逾期支付需额外支付月租金2%的滞纳金。
第三条 租赁期限
租赁期自2024年7月1日起至2026年6月30日止,共24个月。
租赁期满后,如乙方续租,月租金上调10%。
第四条 设备维护
租赁期间设备的日常维护由乙方负责。
设备出现非人为故障时,由甲方负责维修,维修费用由甲方承担。
因乙方操作不当导致的损坏,维修费用由乙方承担。
第五条 违约责任
乙方提前终止合同的,应支付剩余租期租金总额的30%作为违约金。
甲方提前终止合同的,应退还乙方已付的全部押金,并支付等同于一个月租金的补偿金。
第六条 争议解决
因本合同引起的争议,提交甲方所在地人民法院诉讼解决。
第七条 其他
乙方应妥善保管和使用租赁设备,租赁期满时按原状归还。"""
with open(os.path.join(contracts_dir, "采购合同_绿源食品.txt"), "w", encoding="utf-8") as f:
f.write(sample1)
with open(os.path.join(contracts_dir, "设备租赁合同_智厨科技.txt"), "w", encoding="utf-8") as f:
f.write(sample2)
print("已创建示例合同文件")
# 批量审核
print("开始批量合同审核...\n")
df = batch_review_contracts(contracts_dir)
# 打印概览
print_summary(df)
# 导出Excel
export_to_excel(df)运行效果:
发现 2 份合同文件
[1/2] 正在审核:采购合同_绿源食品.txt ... 完成
[2/2] 正在审核:设备租赁合同_智厨科技.txt ... 完成
==================================================
合同审核概览
==================================================
合同总数:2
高风险:1 份
中风险:1 份
低风险:0 份
高风险合同清单(1 份):
- 采购合同_绿源食品.txt:违约金比例偏高(每日0.5%),争议仲裁地在对方城市
审核结果已导出到:./contract_review_results.xlsxExcel里大概长这样(摘取关键字段):
文件名 | 整体风险等级 | 高风险项数量 | 风险详情 |
|---|---|---|---|
采购合同_绿源食品.txt | 高 | 3 | [高] 违约金每日0.5%偏高,年化超过180%; [高] 仲裁地为上海(对方所在地); [中] 自动续期条款缺少退出机制 |
设备租赁合同_智厨科技.txt | 中 | 1 | [高] 提前终止需支付剩余租金30%违约金; [中] 续租租金上调10%未设上限 |
老陈拿到这个工具之后,把两百多份合同的文本版丢进去,跑了一个下午全审完了。Excel里高风险的合同单独挑出来人工细看,中低风险的基本过一眼就行。
他后来跟我说,还真查出来三份合同有严重问题,其中一份的违约金条款跟范本对不上,差点就签了。
用这个方法审合同有个前提:你得先把合同转成纯文本。如果是扫描件PDF,需要先用OCR工具(比如pytesseract)提取文字。这一步不复杂,但合同量大的话建议提前处理好。
本文分享自 Nicholas与Pypi 微信公众号,前往查看
如有侵权,请联系 cloudcommunity@tencent.com 删除。
本文参与 腾讯云自媒体同步曝光计划 ,欢迎热爱写作的你一起参与!