Daily Briefing

October 6, 2026
2026-10-05
52 articles

Mistral raises €3B to make sovereign, open-weight AI the technology frontier

유럽 AI 기업 Mistral이 오픈웨이트 기반의 소버린 AI 기술 역량 강화 및 글로벌 인프라 확장을 위해 30억 유로 규모의 시리즈 D 투자를 유치했습니다.

  • Mistral이 삼성전자 주도로 Scaleup Europe Fund, PSG Equity 등이 참여한 시리즈 D 라운드에서 30억 유로 투자를 유치하며 기업 가치 210억 유로를 돌파했습니다.
  • 이번 투자금은 프론티어 AI 연구 및 모델 학습용 컴퓨팅 파워 확대, 글로벌 인프라 구축과 상용화 가속화에 투입될 예정입니다.
  • 데이터 내부 보관, 제어 가능한 모델, 독립된 컴퓨팅 환경을 아우르는 소버린 AI 풀스택을 통해 벤더 종속 없이 기업의 미션 크리티컬 AI 전환을 지원합니다.
Notable Quotes & Details
  • €3B
  • €21 billion
  • largest equity fundraising round ever completed by a European technology company
  • 125+ global enterprises
  • 20 countries

AI 및 IT 산업 관계자, 기술 투자자, 엔터프라이즈 인프라 및 데이터 거버넌스 담당자

Hallo, Deutschland!

Mistral AI가 독일 뮌헨에 신규 허브를 개설하여 유럽 최대 제조·산업 기업들을 위한 산업용 및 물리학 AI 역량 강화와 유럽 AI 주권 구축에 나섰습니다.

  • Mistral이 뮌헨에 물리학 AI(Physics AI) 및 산업용 AI 전문 연구팀과 현장 엔지니어를 배치하는 새로운 기술 허브를 설립함
  • 2026년 5월 인수한 Emmi AI의 인력을 바탕으로 BMW와는 충돌 시뮬레이션, Siemens Energy와는 산업용 AI 분야에서 실증 협력을 진행 중임
  • 유럽의 AI 주권 확보를 위해 2030년까지 1기가와트(GW) 규모의 컴퓨팅 용량을 구축하고 오픈 가중치 아키텍처 기반의 안전한 엔터프라이즈 환경을 제공함
Notable Quotes & Details
  • To secure Europe’s AI sovereignty, Mistral will build one gigawatt of European compute capacity by 2030.
  • Following our acquisition of Emmi AI in May 2026, more than 30 physicists, researchers, and engineers with unique expertise in Physics and Engineering AI joined Mistral.
  • Mistral is a powerful example of what Europe can achieve: developing cutting-edge technology, turning it into a global success, and taking responsibility at the same time. - Dr. Karsten Wildberger, German Federal Minister for Digital Transformation and Government Modernisation

유럽 및 글로벌 제조·엔지니어링 기업 관계자, 산업용 AI 도입을 추진하는 엔지니어 및 기술 경영진, 유럽 AI 주권 관련 정책 입안자

Mistral and Mozilla are bringing open, private and multilingual AI to your web browser

Mistral과 Mozilla가 협력하여 Firefox의 AI 브라우징 어시스턴트인 'Firefox Smart Window'에 Mistral의 오픈 가중치 언어 모델을 도입합니다.

  • Firefox Smart Window(베타)는 탭 기반 정보 탐색, 복잡한 검색 정리, 이전 탐색 내용 기억 등을 지원하며 Mistral 모델로 구동됩니다.
  • 프랑스와 북미 사용자에게 우선 제공되며, 올해 말 영국과 독일로 지원 대상이 확대될 예정입니다.
  • 지역 언어, 방언 및 문화적 뉘앙스를 반영한 미세조정과 함께 Mozilla 서버 대화 미저장 및 Mistral의 무데이터 보존 정책 등 프라이버시 보호 기능이 적용됩니다.
Notable Quotes & Details
  • Firefox Smart Window (beta)
  • Mistral will help power Smart Window for users in France and North America, with the United Kingdom and Germany expected to follow later this year.
  • conversations aren’t saved on Mozilla’s servers by default, and partners like Mistral agree to zero data retention.

웹 브라우저 사용자, 오픈소스 및 프라이버시 중심 AI 기술에 관심이 있는 개발자와 일반 대중

Cloudera and Mistral Partner to Bring Specialized, Sovereign Intelligence to Enterprise Data

Mistral과 Cloudera가 파트너십을 맺고 엔터프라이즈 환경에서 데이터 주권을 유지하며 맞춤형 AI 모델을 구축·운영할 수 있도록 지원한다.

  • Mistral의 AI 모델이 Cloudera의 하이브리드 데이터 플랫폼과 통합되어 온프레미스, 퍼블릭/프라이빗 클라우드, 완전 폐쇄망(air-gapped) 환경에서 추론을 실행할 수 있도록 지원합니다.
  • 기업이 통제된 환경 내에서 독점 데이터를 활용해 자체 AI 모델을 학습시키고, 데이터와 파생된 인텔리전스에 대한 완전한 소유권을 유지할 수 있게 합니다.
  • 규제 산업군(금융, 제조, 통신 등)의 데이터 주권(sovereign AI) 수요에 대응하여 Cloudera 플랫폼이 관리하는 30엑사바이트 규모의 고객 데이터에 Mistral AI 역량을 결합합니다.
Notable Quotes & Details
  • "Every enterprise is heading toward the same destination: specialized intelligence," said Abhas Ricky, Chief Business Officer & GM, Applied AI at Cloudera.
  • "That’s the shift we’re building for: 'from renting generic AI to owning intelligence that’s uniquely theirs.'"
  • "It’s a privilege to have the opportunity to bring Mistral’s sovereign AI to Cloudera’s 30 exabytes of customer-managed data running on its platform." - Kamal Brar, SVP of Partnerships & Alliances at Mistral
  • 30 exabytes

엔터프라이즈 데이터 및 AI 전략 책임자, 하이브리드 클라우드 엔지니어, 금융·제조·통신 등 규제 산업의 IT 의사결정권자

Modernizing complex legacy code with AI agents.

미스트랄(Mistral)이 AI 에이전트와 구조화된 워크플로를 활용해 유럽 에너지 기업의 복잡한 40,000줄 규모 Fortran 77 레거시 코드를 현대적인 C++로 성공적으로 마이그레이션한 사례를 소개합니다.

  • 수식 검증을 위한 동등성 하네스 구축, AI 에이전트를 통한 코드베이스 문서화, 인간의 검토를 결합한 구조화된 워크플로를 통해 40,000줄의 Fortran 77 저류층 시뮬레이터를 C++로 현대화했습니다.
  • 절차형 언어에서 객체 지향 C++로의 전환은 아키텍처 리팩터링을 수반하며, 전역 메모리(COMMON 블록) 및 암시적 타입 등 Fortran 77의 제약으로 인해 단순 문법 변환을 넘어선 검증 체계가 필수적입니다.
  • 성공적인 레거시 현대화를 위해서는 최종 결과 및 주요 중간 지점의 수치적 일치 우선 검증, 마이그레이션 전 문서화 정리, 에이전트의 자율성과 엔지니어의 검토 간 균형 유지가 핵심입니다.
Notable Quotes & Details
  • 40,000 lines of Fortran 77 to C++
  • Fortran 77 was standardized in 1977
  • Translating syntax from one language to another is a largely solved task.

소프트웨어 엔지니어, 레거시 시스템 현대화 담당자 및 AI 에이전트를 개발에 도입하려는 개발팀

From Scan to Treatment Plan, AI Helps Close Breast Cancer’s Deadliest Gaps

NVIDIA Inception 프로그램 참여 스타트업들이 유방암 검진부터 치료 계획까지 의료 공백을 메우기 위해 AI 기반 설루션을 개발하고 있습니다.

  • 미국 내 영상의학과 전문의 부족과 장기간 소요되는 유전자 검사로 인해 유방암 조기 진단 및 신속한 치료 결정에 병목 현상이 발생하고 있습니다.
  • iSono Health는 FDA 승인을 받은 웨어러블 자동화 3D 초음파 플랫폼 'ATUSA'를 통해 기존 최대 45분 걸리던 검사를 유방당 약 2분으로 단축하고 민감도를 28% 향상시켰습니다.
  • 표준화된 자동 검사로 조작자 오류를 줄이고 연간 비교 분석을 가능하게 하며, 현재 다기관 임상 연구를 통해 멀티모달 진단 인텔리전스로 확장을 추진 중입니다.
Notable Quotes & Details
  • 미국에서 매년 약 40 million 건의 유방촬영술이 시행되나 향후 10년간 수만 명의 영상의학과 의사 부족이 예상됨
  • iSono Health의 ATUSA 시스템은 유방당 검사 시간을 기존 최대 45분에서 약 2분으로 단축하고, 수기식 2D 초음파 대비 민감도가 28% 더 높음
  • ATUSA의 AI는 1.5 million 개 이상의 초음파 프레임이 포함된 수천 건의 전유방 스캔으로 훈련됨
  • UC Davis 및 Vanderbilt University Medical Center 주도로 3,200명의 환자를 대상으로 한 다기관 임상 연구 진행 중
  • Neda Razavi, CEO of iSono Health: "Getting the scan closer to the patient is the first breakthrough. Our vision is to make that scan increasingly informative: helping clinicians see what is there, understand what has changed and make more informed decisions."

헬스케어 AI 및 의료 기술 관계자, 헬스케어 투자자, 영상의학 및 종양학 의료진

Notes: 본문 말미(Whiterabbit.ai 소개 부분)가 잘려 있어 내용이 일부 불완전함

North 2: Enterprise AI without compromises

Cohere가 엔터프라이즈 환경을 위해 오케스트레이션과 거버넌스 기능을 대폭 강화하고 다양한 배포 옵션을 지원하는 에이전틱 AI 플랫폼 'North 2'를 공개했습니다.

  • 복잡한 다단계 업무 자동화 및 에이전트 구성을 지원하는 재설계된 오케스트레이션 하네스를 도입했습니다.
  • Cohere 자체 모델뿐만 아니라 외부 모델도 연동 가능한 모델 애그노스틱 환경과 클라우드, 온프레미스, 망분리(air-gapped) 환경의 유연한 배포를 지원합니다.
  • Slack, SharePoint, Jira, GitHub 등 다양한 엔터프라이즈 도구 연동과 재사용 가능한 스킬, 메모리, 세부 비용 및 사용량 제어 거버넌스 기능을 제공합니다.
Notable Quotes & Details
  • North gives enterprises a secure, practical foundation for turning agentic AI into real business value.

기업 IT 의사결정권자, 엔터프라이즈 AI 엔지니어 및 자동화 시스템 도입 담당자

Researchers are tracking a Chinese AI ‘agent fleet’

독립 연구진이 텐센트 인프라에서 구동되며 알리바바의 지도 서비스를 대상으로 병렬 활동을 벌이는 중국계 AI 에이전트 선단을 추적하고 있습니다.

  • 연구진은 에이전트 간 상호 통신 흔적이 없어 '스웜(군집)'이 아닌 '에이전트 함대(agent fleet)' 형태로 다수의 병렬 작업을 수행 중이라고 분석했습니다.
  • 도메인 스캐닝 서비스인 URLquery의 트래픽 모니터링을 통해 에이전트들이 공원, 동물원, 병원 등 공공장소 출입구 길찾기 쿼리를 전송한 기록이 포착되었습니다.
  • 현재까지는 알리바바의 API 규정을 우회하는 수준으로 파악되나, 최근 인터넷상에서 정체불명의 비인가 AI 에이전트 활동이 지속적으로 증가하고 있습니다.
Notable Quotes & Details
  • ‘Agent fleet,’ not ‘swarm:’ many parallel agents on the same kind of task, with no sign of communication between them.

AI 보안 전문가, 인프라 엔지니어 및 웹 플랫폼 보안 담당자

Meet the Startup Battlefield 200 judges who’ll decide the winner at TechCrunch Disrupt 2026

TechCrunch Disrupt 2026의 Startup Battlefield 200 결선에서 최종 우승자를 결정할 주요 심사위원단 라인업을 소개한다.

  • 수천 개의 스타트업 중 200개사가 선정되었으며, 그중 20개 기업이 2026년 10월 13일부터 15일까지 무대에서 피칭을 진행한다.
  • 결선 심사위원은 각자 투자사를 직접 설립하거나 공동 설립한 베테랑 투자자 5인으로 구성된다.
  • Cherryrock Capital의 Stacy Brown-Philpot, Goodwater Capital의 Chi-Hua Chien, Construct Capital의 Dayna Grayson, M13의 Carter Reum 등 주요 심사위원의 경력과 투자 포트폴리오가 공개되었다.
Notable Quotes & Details
  • Competition goes from October 13-15 at TechCrunch Disrupt 2026
  • Thousands of startups applied. Just 200 made Startup Battlefield . Only 20 will pitch on the Disrupt Stage across all three days.
  • M13 , a consumer technology venture firm with $1.9 billion under management

스타트업 창업가, 벤처 투자자, 글로벌 테크 콘퍼런스 참가자

Can Safeworld convince people that GenAI robots won’t hurt them?

카네기 멜론 대학 출신 연구진이 생성형 AI 기반 휴머노이드 로봇의 안전성을 검증하고 시뮬레이션 평가 플랫폼을 개발하는 스타트업 '세이프월드(Safeworld)'를 설립하고 1,200만 달러 규모의 시드 투자를 유치했다.

  • 전통적 알고리즘과 달리 예측이 어려운 생성형 AI 제어 로봇의 위험성을 평가하고 신뢰를 구축하기 위해 세이프월드가 설립되었다.
  • 세이프월드는 Genesis, MuJoCo 같은 물리 시뮬레이션 환경에서 실제 인간 모델과 비정형 환경을 모사해 로봇의 충돌 방지 및 안전성을 사전에 검증한다.
  • Shine Capital과 a16z Speedrun의 주도로 1,200만 달러 이상의 시드 투자를 유치하며 본격적인 활동을 시작했다.
Notable Quotes & Details
  • seed round of more than $12 million
  • “The time to build an industry safety standard is now while robots are being designed and deployed,” Jonathan Lai
  • “The safety challenge that we’re talking about is a combination of, one, really advanced generative AI probabilistic evals... The second part that’s really hard is the trust part, and you need both to deploy a robot.” Dr. Ding Zhao

로보틱스 개발사, AI 안전 연구자, 기술 투자자 및 관련 업계 종사자

An open-source tool lets you delete 12GB of Apple Intelligence data on macOS

macOS에서 애플 인텔리전스 관련 기능을 비활성화하고 12GB 이상의 AI 모델 데이터를 삭제해 저장 공간을 확보해 주는 오픈소스 도구 'RemoveMacAI'가 공개되었습니다.

  • macOS 27에서 애플 인텔리전스를 일괄 비활성화하는 토글이 사라지고 모델 데이터가 디스크에 유지되는 문제를 해결하기 위해 개발되었습니다.
  • Siri, Writing Tools, Genmoji, Image Playground, ChatGPT 확장 기능 등을 한 번에 끄고 모델을 삭제하며 재다운로드를 차단합니다.
  • 변경 사항은 macOS 업데이트 후에도 유지되며, 'removemacai revert' 명령어로 설정을 복구할 수 있고 받아쓰기 기능은 정상 유지됩니다.
Notable Quotes & Details
  • Even when everything is off, the foundation models stay on disk, and that’s about 12 GB.
  • On my MacBook Air, Apple Intelligence is listed as taking up 35.05GB of space
  • macOS 27

Mac 저장 공간 확보가 필요하거나 애플 인텔리전스 기능을 사용하지 않고 완전히 비활성화하려는 Mac 사용자 및 개발자

OpenAI is sticking more ads in ChatGPT

OpenAI가 ChatGPT에서 이미지 생성 시 스폰서 제품 및 서비스를 노출하는 새로운 시각적 광고 형식을 도입하여 미국에서 테스트를 시작합니다.

  • OpenAI는 ChatGPT에서 이미지 생성 시 화면에 스폰서 제품과 서비스 이미지를 표시하는 시각적 광고 형식을 이번 달 말 미국에서 테스트할 예정입니다.
  • 새로운 시각적 광고는 생성된 이미지와 분리되어 표시되며 ChatGPT의 답변 내용에 영향을 미치지 않도록 설계되었습니다.
  • Plus, Pro, Enterprise 등 유료 요금제 구독자에게는 광고가 노출되지 않으며, 감정적으로 취약하거나 민감한 맥락에서는 광고를 차단하는 안전장치가 적용됩니다.
Notable Quotes & Details
  • The ads, which OpenAI will begin testing in the US later this month, will “initially” appear when you generate images with ChatGPT
  • The company first brought ads to ChatGPT in February.
  • visual ad format will similarly remain separate from the image you generate and will “not influence the answers ChatGPT provides.”
  • Ads won’t appear if you subscribe to ChatGPT’s Plus, Pro, or Enterprise plans.

ChatGPT 일반 사용자, 디지털 마케터 및 광고 업계 관계자, AI 서비스 비즈니스 모델에 관심 있는 독자

Our minds aren’t equipped to handle AI

인간의 뇌를 단순한 컴퓨터 알고리즘으로 취급하는 AI 산업의 관점에 반박하며 뇌를 진화적 피드백 제어 시스템으로 이해해야 한다고 주장하는 기사입니다.

  • AI 산업은 뇌를 '생물학적 튜링 머신'이나 '생물학적 컴퓨터'와 같은 단순 정보 처리 장치로 간주하지만 이는 인간의 복잡성을 간과한 시각입니다.
  • 인지 과정을 단순한 입력-연산-출력의 세 단계 알고리즘으로 환원하는 계산주의적 모델은 뇌의 실제 진화 역사를 반영하지 못합니다.
  • 몬트리올 대학교의 신경과학자 Paul Cisek은 뇌를 단순한 정보 처리기가 아니라 환경과 상호작용하며 입력을 능동적으로 조절하는 피드백 제어 시스템으로 바라보아야 한다고 주장합니다.
Notable Quotes & Details
  • The thought of every age is reflected in its technique.
  • a biological approximation to a Turing machine
  • people should just think of the brain as a biological computer.
  • exceptional complexity of the human nervous system

인공지능 철학, 인지과학 및 뇌과학적 관점에서 AI의 발전 방향과 한계에 관심 있는 대중 및 개발자

Yandex Introduces Sona: A Single Generative Recommender That Replaces Entire Recommendation Cascade

Yandex가 다단계 추천 시스템 파이프라인을 단일 생성형 트랜스포머 모델로 대체한 통합 추천 아키텍처 'Sona'를 발표했습니다.

  • 기존 후보 생성, 사전 순위 지정, 무거운 순위 지정 등 15개 이상의 모델로 나뉜 캐스케이드 구조를 단일 모델로 통합했습니다.
  • 수작업 피처 엔지니어링을 배제하고 로그 이벤트와 3개 코드 기반 Semantic ID를 활용하여 사용자의 단일 표현을 공유합니다.
  • 이력 압축 기법을 적용한 인코더와 시맨틱 토크나이저, 그리고 0.6B 규모의 교사 모델로부터 롤아웃 증류(Rollout Distillation) 방식을 통해 학습했습니다.
Notable Quotes & Details
  • Recall@1000 rose from 0.8111 to 0.8524
  • Sona attends to 8,192 past events
  • recent 2,048 events get a 7-layer self-attention stack
  • The teacher is a 0.6B-parameter transformer
  • weighted pair accuracy from 0.6215 to 0.6153

추천 시스템 엔지니어, 머신러닝 연구원, 대규모 AI 서빙 인프라 개발자

The Story of Qwen: Alibaba’s AI Models From 7B to 2.4T

알리바바의 오픈소스 AI 모델 'Qwen'이 2023년 초기 모델부터 2.4조 개 매개변수 규모로 발전해 온 진화 과정과 주요 릴리스 역사를 다룬 기사입니다.

  • 2023년 4월 통이치엔원(Tongyi Qianwen) 공개 이후 8월에 메타의 Llama 2에 대응하여 Qwen-7B를 오픈소스로 공개하며 본격적인 확장을 시작했습니다.
  • 2024년 한 해 동안 Qwen1.5, Qwen2, Qwen2.5 등 8개월 만에 3세대를 출시하며 Apache 2.0 라이선스 적용 및 최대 128K 컨텍스트 지원 등으로 개발자 표준 오픈 모델로 자리잡았습니다.
  • 비전(Qwen-VL), 수학(Qwen2-Math), 오디오, 코딩(Qwen2.5-Coder) 등 다양한 특화 모델을 선보이고 다운로드 4천만 건과 5만 개 이상의 파생 모델을 기록하며 영향력을 확대했습니다.
Notable Quotes & Details
  • 2.4 trillion parameters
  • August 3, 2023, Alibaba open-sourced Qwen-7B and Qwen-7B-Chat
  • Qwen-7B was pretrained on over 2.2 trillion tokens with a 2,048-token context
  • On September 19, 2024, Alibaba released over 100 open-source models at once
  • pretraining data grew from 7 trillion to 18 trillion tokens
  • passed 40 million downloads and inspired over 50,000 derivative models on Hugging Face

오픈소스 LLM 생태계와 알리바바의 AI 모델 발전 과정에 관심이 있는 AI 연구자 및 소프트웨어 개발자

Can an Open Model Do Security Research? Cantina’s apex-flash-1 Solves 40 of 60 Held-Out Bug Tasks

Cantina Security와 Yeta Labs가 취약점 연구에 특화되어 오픈소스로 공개한 321.3B 규모의 보안 강화 모델 apex-flash-1에 대한 소개 및 성능 벤치마크 결과입니다.

  • Z.ai의 GLM-5.3-Flash를 기반으로 실제 취약점 사례 데이터를 활용해 GRPO 강화학습으로 미세조정한 321.3B 파라미터 오픈 가중치 모델(MIT 라이선스)입니다.
  • 20개 미공개 취약점 사례 기반 60개 태스크 평가에서 66.7%(40/60)의 성공률을 기록하여 Claude Opus 5 High(71.7%)에 근접한 성능을 보였습니다.
  • 오케스트레이터 모델의 지시를 받아 코드 분석, 도구 사용, 익스플로잇 개발 및 검증을 수행하는 전문 워커 모델로 설계되었으며, Claude 대비 약 31배 저렴한 비용 효율성을 제공합니다.
Notable Quotes & Details
  • apex-flash-1: 40/60 solved (66.7% pass@1), about $2.38
  • Claude Opus 5 High: 43/60 solved (71.7%), about $74.68
  • BF16 needs roughly 640 GB of GPU memory
  • 321.3B total parameters, 18B active parameters (Mixture-of-Experts)

보안 연구원, 침투 테스트 엔지니어, AI 보안 시스템 개발자

Meta Muse Explained: What It Is, How It Works, and What It Can Do

메타가 사용자의 목표를 이해하고 웹 탐색, 결제, 서브에이전트 실행 등 복잡한 작업을 24시간 자율 수행하는 개인용 AI 에이전트 '뮤즈(Muse)'를 출시했습니다.

  • 메타가 단순 챗봇을 넘어 계획 수립, 도구 활용, 작업 모니터링을 자율적으로 수행하는 개인용 AI 에이전트 Muse를 공개했습니다.
  • Muse Spark 1.3 추론 엔진을 기반으로 장기 워크플로 관리 및 다중 서브에이전트 병렬 조율 기능을 지원합니다.
  • 각 사용자에게 격리된 Linux 가상 머신(VM) 환경을 제공하여 파일 작업, 코드 실행, 영구적 상태 유지를 안전하게 처리합니다.
Notable Quotes & Details
  • September 8, 2026
  • Mark Zuckerberg: "Introducing Muse, the personal agent that understands your goals and works 24/7 to get things done for you."
  • Muse Spark 1.3

AI 에이전트 기술, 자율 워크플로 자동화 및 신기술 도입에 관심 있는 개발자와 일반 사용자

3 Statsmodels Tricks for Time Series Analysis & Forecasting

파이썬 statsmodels 라이브러리에서 직접 재구현하지 않고 내장 메서드를 효율적으로 활용하는 시계열 분석 및 예측 팁 3가지를 소개합니다.

  • 단순 점 예측 대신 get_forecast()를 활용해 모델이 이미 계산한 신뢰구간(conf_int)과 불확실성 정보를 손쉽게 추출할 수 있습니다.
  • 새로운 관측치가 추가되었을 때 전체 모델을 재학습(.fit())하는 대신 append()나 extend()를 사용해 기존 파라미터를 유지(refit=False)하며 효율적으로 업데이트할 수 있습니다.
  • 계절성 분해와 예측, 재결합 과정을 수동으로 처리하는 대신 STLForecast 객체를 활용하여 번거로운 계산 과정과 인덱스 오류를 방지할 수 있습니다.
Notable Quotes & Details
  • statsmodels 0.15.0
  • res.forecast(12)
  • res.get_forecast(12)
  • refit=False
  • STLForecast

파이썬과 statsmodels를 활용하여 시계열 데이터 분석 및 예측 작업을 수행하는 데이터 사이언티스트 및 머신러닝 엔지니어

Fast Models, Slow Evidence: A Paired and Self-Audited Evaluation of System-1 Decision Models for LLM Agent Harnesses

LLM 에이전트 하네스의 소규모 의사결정을 단일 순방향 패스로 처리하는 시스템 1 모델(Laya, Jev)의 성능과 신뢰성을 11개 의사결정 지점에서 비교 및 자체 감사한 연구입니다.

  • 호스팅 모델인 Jev는 11개 평가 항목 중 9개에서 오픈 가중치 모델인 Laya보다 유의미하게 높은 정확도(+10.8~+46.0%p)를 기록했습니다.
  • 두 모델 모두 제로샷 모델 라우팅에서는 무작위 확률 수준을 넘지 못했고 RAG 관련성 게이팅에서는 동률을 기록했으며, Laya는 선택지 순서 역전 시 30%가 답을 바꾸는 등 견고성에 취약점을 보였습니다.
  • 자체 파이프라인 감사 결과 사전 스크리닝 비용 누락(보고된 절감률 23.9% vs 실제 4.3%), 표본 내 임계값 왜곡 등 배포 관련 주요 주장을 왜곡하는 분석 오류들이 확인되었습니다.
Notable Quotes & Details
  • 18개 공개 출처 기반 11개 에이전트 결정 지점(기본 7,283건 + 견고성 변형 6,640건)
  • Jev는 11개 중 9개 결정 지점에서 +10.8 ~ +46.0 pp 더 높은 정확도 기록
  • Laya는 선택지 순서가 바뀔 때 답변의 30%를 변경함
  • 50개 최근접 이웃 도구 선택 시 Laya 정확도는 31%로 급감(고유 정답 도구 항목에서 Jev는 98%)
  • 사전 스크리닝 비용 누락으로 보고된 비용 절감 23.9%가 실제로는 4.3%에 불과함
  • https://github.com/David-DL-Space/sys1-eval

LLM 에이전트 시스템 및 라우팅/게이팅 파이프라인을 설계하고 비용·지연 시간을 최적화하려는 AI 엔지니어 및 연구자

The AI Risk Observatory: What Can We Learn from AI Disclosures in Annual Reports About Societal Resilience?

영국 상장기업의 연례 보고서를 대규모 LLM 파이프라인으로 분석하여 기업의 AI 도입 및 위험 공시 양상을 평가하고 사회적 회복탄력성에 미치는 시사점을 도출한 연구입니다.

  • 2020년부터 2025년 사이 기업 연례 보고서 내 AI 위험 언급 비율은 2.8%에서 41.2%로, AI 도입 언급 비율은 13.8%에서 45.2%로 급증했으며 공급업체 언급은 Microsoft 등 일부 주요 기업에 집중되었습니다.
  • 시장 부문 및 주요 국가 인프라(CNI) 분야별 편차가 뚜렷하여 AIM 상장 기업과 에너지, 데이터 인프라 부문의 AI 위험 공시 비율이 주요 시장 대비 크게 뒤처졌습니다.
  • AI 관련 실제 피해(harm) 공시는 전체 기간 통틀어 7건에 불과했으며, 2025년 기준 위험을 언급한 기업 41.2% 중 실질적인(substantive) 공시를 수행한 기업은 4.3%에 그쳐 공시의 질적 수준이 미흡한 것으로 나타났습니다.
Notable Quotes & Details
  • 1,362개 영국 상장기업의 9,821건 연례 보고서(2020-2025년 및 2026년 일부 데이터) 분석
  • AI 위험 언급 비율 2.8%(2020년)에서 41.2%(2025년)로 증가
  • AI 도입 공시 비율 13.8%(2020년)에서 45.2%(2025년)로 증가
  • 피해(harm) 공시는 전체 코퍼스 통틀어 단 7건
  • 2025년 기준 AI 위험을 언급한 보고서는 41.2%였으나, 실질적(substantive) 위험 공시로 분류된 비율은 4.3%에 불과

AI 거버넌스 및 정책 연구자, 기업 공시 및 위험 관리 전문가, 투자자 및 규제 당국

Keep It CALM: Analyzing the Limits of Global Unsafety in Text-to-Image Generation

텍스트-이미지 생성 모델에서 기존 전역 유해성 제거 방식의 한계를 분석하고 프롬프트별 국소 반사실적 교정을 수행하는 학습 불필요 안전 가드레일 CALM을 제안한 논문입니다.

  • 기존의 전역적 유해 부분공간 제거 방식은 다양한 유해 의미를 완전히 포괄하지 못하거나 무해한 인접 프롬프트까지 왜곡하는 포괄성-선택도 간 트레이드오프 문제가 존재함을 기하학적으로 규명했습니다.
  • 일률적인 전역 제거 대신 프롬프트 단위로 활성화된 유해 범주를 파악하고 위반 토큰 표현만 안전한 방향으로 최소 수정하는 CALM(Counterfactual Adaptive Local Modulation)을 제안했습니다.
  • 다양한 평가 결과 CALM은 무해한 프롬프트의 생성 품질과 유용성을 보존하면서도 유해 콘텐츠 억제 성능을 대폭 향상시켰습니다.
Notable Quotes & Details
  • arXiv:2610.02300v1
  • CALM (Counterfactual Adaptive Local Modulation)

생성형 AI 안전성 연구자, 텍스트-이미지 모델 가드레일 개발자, 머신러닝 연구진

Choosing Before Acting: Comparative Value Estimation for Long-Horizon Tool-Use Agents

장기 도구 활용 에이전트가 도구를 실행하기 전에 다음 도구 호출의 장기적 가치를 비교 및 평가할 수 있도록 돕는 CITA 프레임워크에 관한 연구입니다.

  • 장기 상호작용에서 최종 결과 기반 보상은 기여도 배분이 약하고, 단계별 보상은 감독 비용이 많이 든다는 한계를 지적합니다.
  • 실제 행동 전 동일 문맥 내 대안적 호출을 비교 평가할 수 있도록 베이지안 도구 그래프 시뮬레이터와 LLM 기반 비교를 결합한 비교 추론 모델(CIM)을 훈련하는 CITA를 제안합니다.
  • 3가지 도구 활용 벤치마크 및 다양한 백본 LLM 실험을 통해 Tool F1 점수와 최종 작업 성공률을 지속적으로 향상함을 검증했습니다.
Notable Quotes & Details
  • arXiv:2610.02330v1

LLM 기반 에이전트 및 도구 활용(Tool-use) 연구자 및 엔지니어

DeReAct: Decomposed Reasoning and Acting for Reliable AI Agents

단일 LLM 정책의 결합 문제를 해결하기 위해 행동 검증과 완료 제어를 분리한 모듈형 AI 에이전트 아키텍처 DeReAct를 제안한 연구입니다.

  • 기존 ReAct 에이전트의 단일 LLM 의존으로 인한 오류 전파와 근거 없는 조기 종료 문제를 해결하기 위해 DeReAct 아키텍처를 도입했습니다.
  • 실행 전 행동을 검증하는 'Critic'과 환경 기반 상태를 재구성해 작업 완료를 인증하는 'Context Manager'라는 두 가지 외부 게이팅 정책을 분리했습니다.
  • GAIA 및 SWE-bench Verified 벤치마크 평가 결과, 특히 상대적으로 성능이 낮은 Brain 모델에서 Pass@1 성능이 크게 향상되었으며 모델이 강력해져도 근거 기반 안정성을 유지했습니다.
Notable Quotes & Details
  • arXiv:2610.02351v1
  • Qwen3-Coder-480B 모델에서 Pass@1 6.5~7.0 포인트 향상
  • Claude Sonnet 4.5 모델에서 Pass@1 4.2~5.2 포인트 향상

AI 에이전트 시스템 설계자, LLM 연구원 및 자율 에이전트 개발자

Hybrid Machine Learning-Assisted Raman Spectroscopy with Generative Feature Augmentation for Pharmaceutical Identification

딥러닝 특징 추출과 생성형 데이터 증강 기법을 결합하여 6종의 의약품 잔류물을 신속하고 정확하게 식별하는 하이브리드 라만 분광 분석 프레임워크 연구

  • 라만 스펙트럼을 스펙트럼 이미지로 변환한 후 EfficientNet-B3 백본으로 1536차원 임베딩을 추출하고 전통적 머신러닝 분류기와 결합하는 HyMLRaman 프레임워크 제안
  • EfficientNet-B3와 SVM을 결합한 하이브리드 구성이 96.31%의 정확도와 96.36%의 매크로 F1 점수를 기록하며 단독 CNN 베이스라인을 능가함
  • 데이터 부족 환경을 극복하기 위해 DDPM 기반 특징 증강 기법을 도입하여 저데이터 환경(특히 KNN)에서 성능 개선 효과를 입증하고 대화형 분석기 구현 가능성을 제시함
Notable Quotes & Details
  • 6종 의약품: amoxicillin, chloramphenicol, ciprofloxacin, tetracycline, ibuprofen, paracetamol
  • 1536-dimensional embeddings
  • EfficientNet-B3--SVM: 96.31% accuracy, 96.36% macro-F1 score
  • arXiv:2610.02224v1

의약품 안전 및 식품 안전 분석 연구자, 분광학 및 바이오센서 기반 머신러닝 연구자, AI 의료 진단 개발자

The Price of Greenwashing: Algorithmic Verification and Market Discipline using Conformal Machine Learning

적합 예측 머신러닝 기법을 활용해 기업의 자체 보고 탄소 배출량과 실제 물리적 배출량 간의 격차를 정량화하고, 그린워싱이 기업의 시장 가치와 수익성에 미치는 부정적 영향을 입증한 연구입니다.

  • 미국 SEC의 재무 펀더멘털 데이터와 EPA 시설 수준 온실가스 등록부를 결합하고 경사 하강 부스팅 및 몬드리안 적합 예측(Mondrian Conformal Prediction)을 적용하여 신뢰할 수 있는 물리적 탄소 배출 기준선을 구축했습니다.
  • 자체 보고된 배출량과 알고리즘 기준선 간의 불일치를 측정하는 새로운 지표인 CWCD(Conformal-Weighted Continuous Divergence)를 개발했습니다.
  • 교차 단면 시차 계량경제학 설계를 통해 분석한 결과, 알고리즘 배출량 격차가 클수록 이후 기업의 시장 가치(Tobin's Q)와 영업 이익률(ROA)이 통계적으로 유의미하게 하락하는 시장 규율 메커니즘을 확인했습니다.
Notable Quotes & Details
  • arXiv:2610.02225v1
  • Mondrian Conformal Prediction
  • Conformal-Weighted Continuous Divergence (CWCD)
  • Tobin's Q
  • ROA

ESG 투자자, 자산 운용사, 금융 규제 당국, 기후 금융 및 AI 연구자

State-Space Unlearning for Non-Stationary Bias in Land Surface Forecasting

지표면 예측용 Mamba 기반 상태공간모델(SSM)에 흡수된 비정상성 편향 이벤트를 효과적으로 제거하는 최초의 머신 언러닝 프레임워크인 SSU-LSF를 제안한다.

  • Mamba 계열 구조화 상태공간모델이 관개 급증이나 댐 운영 변화 등 비정상성 혼란 사건을 상태 전이 행렬에 흡수하여 장기적인 예측 편향을 일으키는 문제를 해결하기 위해 SSU-LSF를 개발했다.
  • Mamba 상태 행렬에 특화된 EKFac 영향력 함수와 스펙트럼 반경 가중치 기반 엘보우 임계값 처리, 공간 전변이(TV) 정규화가 결합된 KL 발산 신뢰 영역 내 헤시안-프리 사영 경사 상승법을 적용했다.
  • 전체 재학습 대비 GPU 비용을 8.4배 절감하면서도 3~5 에포크 만에 수렴하며, 세 가지 벤치마크에서 0.773~0.859의 혼란 요인 감소율을 달성했다.
Notable Quotes & Details
  • arXiv:2610.02248v1
  • 혼란 감소율: CropHarvest에서 0.773, NDVI-LST에서 0.821, ERA5에서 0.859
  • ERA5 기준 최악의 경우에도 클린 도메인 RMSE 성능 저하는 4.2% 수준
  • 전체 재학습 대비 언러닝 요청당 GPU 비용 8.4배 절감 (3~5 에포크 내 수렴)
  • 코드: https://github.com/Anidipta/SSU-LSF

지구과학 인공지능 연구자, 기상·지표면 예측 모델 개발자, 머신 언러닝 및 상태공간모델(SSM) 연구자

Nearest-neighbour baselines for fingerprint prediction from MS/MS spectra under different assumptions

질량분석(MS/MS) 스펙트럼을 통한 분자 지문 예측에서 추론 가정에 따른 다양한 최근접 이웃(Nearest-neighbour) 기법들의 성능을 체계적으로 비교하고 엄격한 기준선을 제시한 연구이다.

  • 최근접 이웃 검색 기법이 MS/MS 스펙트럼 기반 분자 지문 예측에서 기존 딥러닝 모델과 대등하거나 능가하는 강력한 기준선임을 규명했다.
  • 추론 시 사용 가능한 정보 가정에 따라 달라지는 여러 최근접 이웃 변형 방식들을 체계적으로 비교 분석했다.
  • 서로 다른 가정이 성능에 미치는 영향을 검증하여 더욱 엄격한 벤치마킹 및 연구 성과 측정이 가능한 기준선을 수립하고자 했다.
Notable Quotes & Details
  • arXiv:2610.02249v1
  • Khoo and Barzilay, 2026; Liu et al., 2026; Gupta et al., 2026

화학정보학 연구자, 분자 구조 예측 및 생화학 인공지능 연구자

Overcoming Challenges of Interpretive Structural Modeling with Large Language Models

대규모 언어 모델(LLM)을 활용하여 다기준 의사결정 기법인 해석적 구조 모델링(ISM)의 확장성 한계와 전문가 합의 과정의 비효율성을 극복하는 연구입니다.

  • 해석적 구조 모델링(ISM)은 인과 관계 모델링에 효과적이나, 전문가 합의 과정이 번거롭고 수백 개 변수로 확장하기 어려운 한계가 있습니다.
  • 불완전한 전문가로서 LLM을 활용한 인과 그래프 발견 방식을 결합하여 쌍별, k-wise, 행별(rowwise), 전체 그래프 탐색 등 다양한 통합 방법론을 비교·평가했습니다.
  • 실험 결과 행별 탐색(rowwise)과 전체 그래프(full graph) 탐색 방식이 ISM을 위한 인과 그래프 발견에서 가장 우수한 성능을 나타냈습니다.
Notable Quotes & Details
  • arXiv:2610.02254v1
  • rowwise: SHD=160, F1-score=0.77
  • full graph: SHD=135, F1-score=0.73

인과 추론 및 의사결정 모델링 연구자, 대규모 언어 모델(LLM)을 지식 구조화에 활용하려는 AI 연구원

HakemBench: A Turkish Benchmark of Typed Decisions

모델의 유형화된 의사결정 능력을 평가하기 위해 7개 분야로 구성된 터키어 벤치마크 데이터셋 HakemBench v1.0이 공개되었습니다.

  • HakemBench 1.0은 팩트체크 선별, 교육, 가드레일, 법률 라우팅, 모더레이션, 스팸/피싱, 고객 지원 등 7개 트랙에서 2,346개 항목 및 4,275개 질문을 제공하며 CC BY 4.0으로 전면 오픈소스 공개되었습니다.
  • 의사결정 품질(Macro F1), 캘리브레이션, 선택적 자동화 지표를 기하평균으로 통합 평가하며, 옵션 순서 및 패러프레이즈 등 강건성 탐지 평가도 함께 제공합니다.
  • 정답 라벨은 인간 검증이 아닌 대형 언어 모델 패널의 교차 투표로 구축되었으며, 16개 모델 평가 결과 1위 모델은 0.888점을 기록했습니다.
Notable Quotes & Details
  • arXiv:2610.02293v1
  • 2,346 items and 4,275 choice, yes/no and score questions in seven tracks
  • On a board of 16 rows the leader scores a composite of 0.888 and the lab's own model is 7th at 0.660

자연어 처리 및 다국어 LLM 평가 연구자, 터키어 AI 모델 개발자

Finding the Move Is Not Winning the Game: XiangqiBench for Closed-Loop Evaluation of LLM Agents

정적 평가와 실제 폐루프(closed-loop) 실행 간의 성능 격차를 측정하기 위해 중국 장기(Xiangqi)를 활용한 LLM 에이전트 평가 벤치마크 XiangqiBench를 제안한 연구입니다.

  • 단순히 정답 수를 맞히는 것과 상대방의 대응 속에서 최종 체크메이트를 달성하는 실행 능력 간에는 큰 격차가 존재함을 규명했습니다.
  • 12개 최신 LLM을 대상으로 119개의 전술적 엔드게임 상황에서 8,568개의 멀티턴 궤적을 평가하여 세 가지 주요 실패 양상(전환 격차, 일관성 격차, 시뮬레이션 격차)을 발견했습니다.
  • 에이전트가 자체 생성한 수 시뮬레이션의 32.3%가 불법 수로 중단되고 49.3%에서 상대 엔진의 실제 대응을 예측하지 못해, 에이전트 평가 시 정적 지표 대신 폐루프 결과와 신뢰도를 측정해야 한다고 강조합니다.
Notable Quotes & Details
  • arXiv:2610.02425
  • 119 tactical endgames
  • 8,568 multi-turn trajectories from 12 frontier LLMs
  • models play the stored reference first move in 26.1% of Sighted trials, yet only 13.9% of these trials end in a win
  • the leading model reaches 38.7% pass@3 but only 5.9% pass^3
  • 32.3% of accepted simulation calls stop on an illegal move, and in 49.3% of comparable cases the real defender replies differently
  • Finding the move is not winning the game

LLM 기반 에이전트 성능 평가 및 게임 인공지능 연구자

Counterexample Generation via Per-Theorem Symbolic Verifiers: When Imitation Hurts and Reinforcement Repairs

정리별 결정론적 파이썬 검증기를 보상 함수로 활용하여 LLM의 반례 생성 능력을 높이고 모방 학습의 붕괴 문제를 강화학습으로 극복하는 연구.

  • 실행 가능한 검증기가 포함된 학부 수준 대수학 및 실해석학 거짓 추측 4,707개로 구성된 SymCE 데이터셋 구축
  • 반례 전용 지도 미세조정(SFT) 시 참인 정리 인식률이 0.27에서 0.00으로 급락하는 모방 함정이 발생하나, 희소 보상 기반 RLVR(GRPO)을 통해 이를 0.66으로 회복 및 향상
  • 개발된 4B 모델은 평가 대상인 모든 7B 오픈소스 수학 특화 모델을 능가하며, 프롬프트 변경 없이 GSM8K, MATH-500, MMLU-college-math 등 주요 벤치마크로 일반화 성능 입증
Notable Quotes & Details
  • 4,707 false undergraduate-algebra and real-analysis conjectures
  • counterexample-only SFT collapses true-theorem recognition from 0.27 to 0.00, while RLVR with a sparse outcome-only reward repairs this and exceeds the base, to 0.66
  • held-out calibration probe에서 33 points 차이 발생
  • A human audit of 177 verifier decisions finds 97.7% accuracy

인공지능 수학 추론 및 검증, 강화학습(RLVR) 기반 LLM 정렬을 연구하는 AI 연구자 및 엔지니어

FinDialogLens: Event Extraction over Multi-Party Dialogue for Missed-Trade Identification in Financial Chatrooms

복잡한 다자간 금융 채팅방에서 놓친 거래를 식별하기 위해 이벤트 추출 기법을 적용한 하이브리드 LLM 파이프라인 FinDialogLens를 제안한 연구입니다.

  • 경량 파인튜닝 분류기를 활용해 RFQ 트리거와 가격/거래 결과 메타데이터를 감지하고, RFQ 단위 세분화 모듈 및 트레이드 엔진을 통해 인자 역할을 채우는 하이브리드 파이프라인 구축
  • GPT-4o 기반 FinDialogLens는 최종 가격 92.1%, 거래 결과 94.3%의 정확도를 달성하여 기존의 전체 채팅방 대상 CoT 프롬프팅 방식을 능가하며, 3B 규모의 오픈소스 모델로도 유사 성능 확보 가능
  • 난이도 인지 라우터를 도입해 저비용 규칙 기반 엔진과 고성능 LLM 엔진에 RFQ를 분배함으로써 최종 가격 기준 LLM 호출을 85% 감축하고 비용 절감 달성
Notable Quotes & Details
  • GPT-4o 적용 시 최종 가격 정확도 92.1%, 거래 결과 정확도 94.3% 달성
  • 난이도 인지 라우터를 통해 최종 가격 관련 LLM 호출 85% 감축
  • 일일 70,000건의 RFQ 처리 규모에서 일일 $300 이상의 비용 절감 효과

금융 및 트레이딩 도메인 AI 연구자, 금융권 세일즈 앤 트레이딩 실무자 및 LLM 파이프라인 최적화 엔지니어

CUEing User Simulators: Calibrated User Embeddings for Multi-Turn Benchmarking

다중 턴 대화 벤치마크에서 실제 사용자의 성공률과 실패 패턴을 정밀하게 재현하도록 LLM을 유도하는 보정된 사용자 임베딩(CUE) 프레임워크를 제안한 연구입니다.

  • 기존 사용자 시뮬레이터는 겉으로 보이는 대화 스타일은 인간과 유사하지만, 실제 사용자가 AI 에이전트와 상호작용할 때 나타나는 성공률 및 실패 패턴과의 일치도(결과 보정)가 부족함을 발견했습니다.
  • 관찰된 상호작용 세션을 인코딩하고 연속형 표현을 샘플링한 뒤 이를 페르소나 지시어로 디코딩하여, 추가 훈련 없이 LLM 시뮬레이터를 제어하는 CUE 프레임워크를 제시했습니다.
  • τ²-Bench 평가 결과, CUE 기반 시뮬레이터는 시뮬레이터 자체 오류를 줄이고 실제 사용자의 실패 양상과 성공률을 정밀하게 재현했으며 고객 지원 데이터로 구축된 후에도 문서 작성, 수학 튜터링 등 다양한 도메인으로 일반화되었습니다.
Notable Quotes & Details
  • arXiv:2610.02460v1
  • τ²-Bench

대화형 AI 에이전트 및 다중 턴 벤치마크 평가 방법론을 연구하는 AI 연구원 및 개발자

MCPB로 로컬 MCP 서버를 Claude Desktop 원클릭 확장으로 만들기

MCPB 형식을 활용해 로컬 MCP 서버를 Claude Desktop에 브라우저 확장 프로그램처럼 원클릭으로 쉽게 설치하는 방법 소개

  • MCPB(.mcpb)는 로컬 MCP 서버와 manifest.json을 포함하는 단일 zip 패키지 형식임
  • 파일 더블클릭, 창으로 드래그 앤 드롭, 또는 확장 프로그램 설정 메뉴를 통해 손쉽게 설치 가능함
  • 설치된 서버는 사용자 PC의 로컬 환경에서 stdio 방식으로 실행되어 로컬 파일 및 도구와 연동됨
Notable Quotes & Details
  • MCPB(.mcpb)
  • Settings → Extensions → Advanced settings → Install Extension…

Claude Desktop 사용자 및 MCP 서버를 배포하거나 연동하려는 개발자

내 35mm 필름 스캔 파이프라인 자동화하기

오랜 시간이 소요되던 35mm 필름 사진 후처리 작업을 파이썬 기반 알고리즘과 AI 모델을 결합해 자동화한 구축기입니다.

  • 하드웨어 제어 실패 경험을 바탕으로 스캔은 VueScan을 통한 수동 방식으로 유지하고, 네거티브 변환부터 먼지 제거, 메타데이터 생성까지의 후처리를 자동화함
  • NumPy 기반 루틴으로 롤 단위의 색감 일관성을 유지하며 반전을 수행하고, darktable 등 기존 수동 도구에 대한 의존도를 없앰
  • 이미지 분석과 인페인팅 AI 모델인 LaMa를 결합해 먼지를 제거하고, 로컬 Qwen3-VL 모델로 검색 태그를 자동 생성하여 웹 갤러리를 구축함
Notable Quotes & Details
  • 한 롤 36장을 스캔하고 편집하는 데 평균 4시간이 걸리던 작업
  • 11일, 64개 커밋으로 스튜디오와 웹 갤러리를 구축
  • 2020년부터 촬영한 22롤, 314장의 사진
  • 새 스캐너에 200달러를 쓰지 않으려고 직접 수리
  • 초기 검출기는 해변 사진에서 물 위의 햇빛 반짝임 약 2,000개를 먼지로 잘못 판단

필름 사진 후처리를 효율화하려는 사진가 및 AI와 이미지 처리 파이프라인 개발에 관심 있는 개발자

Android에서 시스템 수준으로 광고 차단하기

특정 브라우저를 넘어 Android 운영체제와 모든 앱 전반에 적용할 수 있는 시스템 수준의 광고 차단 원리와 다양한 구현 방법을 소개한다.

  • 시스템 수준 광고 차단은 주로 DNS 조회를 변경해 광고 서버 연결을 원천 차단하는 방식으로 작동한다.
  • 광고 차단 DNS 서비스, 광고 차단 VPN, 로컬 VPN/DNS를 쓰는 비루팅 차단 앱(AdAway 등), 루팅 후 hosts 파일을 수정하는 방식 등의 선택지가 있다.
  • 완벽한 차단은 불가능하며 트래픽 병목 현상이나 악의적 DNS/VPN 운영자에 따른 개인정보 위험이 존재하므로 신뢰할 수 있는 서비스 선택이 중요하다.
Notable Quotes & Details
  • 2026년

Android 기기에서 브라우저 및 앱 전반의 광고와 추적기를 효과적으로 차단하고자 하는 사용자 및 기술 애호가

Show GN: Alpine-Code - 에이전트가 쓸 도구를 직접 개발해 커스터마이징 가능한 코딩 에이전트를 만들었습니다. ...

사용자가 직접 도구를 개발해 확장할 수 있고 한국어 인터페이스를 지원하는 오픈소스 AI 코딩 에이전트 'Alpine-Code'가 공개되었습니다.

  • Codex Desktop과 Claude Desktop의 오픈소스(MIT) 대안으로, 앱 내에서 직접 파이썬 함수로 도구를 개발해 에이전트 루프에 추가할 수 있습니다.
  • 한국어 인터페이스를 기본 제공하며, 용어 설명, 파일 수정 및 명령 실행 전 승인 단계, 상세한 작업 내역과 비용 정보를 표시합니다.
  • 다양한 상용 LLM API(Anthropic, OpenAI, Gemini 등)뿐만 아니라 Ollama, LM Studio 등 로컬 모델 및 터미널 CLI 환경도 지원합니다.
Notable Quotes & Details
  • MIT 라이선스 오픈소스
  • v0.1.0

AI 코딩 에이전트를 커스터마이징하거나 로컬 및 다양한 모델을 활용하고자 하는 개발자 및 비개발자

Show GN: smooth-stream - Claude Code 답변을 타자기처럼 부드럽게 보여주는 mod

청크 단위로 끊겨 출력되는 Claude Code CLI의 스트리밍 응답을 웹처럼 부드럽게 타자기 효과로 보여주는 모드(mod)입니다.

  • Claude Code CLI의 스트리밍 출력을 claude.ai 웹처럼 한 글자씩 부드럽게 애니메이션화하여 표시
  • ui.render 훅과 33ms 타이머를 이용해 텍스트 길이를 점진적으로 늘려가며, 텍스트가 급증해도 약 0.4초 내로 따라잡도록 구현
  • turn.step 훅으로 스트리밍 여부를 추적하여 완료된 메시지나 창 크기 변경 시 불필요한 재렌더링 방지
Notable Quotes & Details
  • #66432, #76432
  • 0.4초
  • 33ms
  • Claude Code 2.1.289

Claude Code CLI 사용자 및 터미널 출력 UI 개선에 관심이 있는 개발자

Sona: one transformer replaced our 15+ candidate generators, pre-ranker and ranker in an A/B test [R]

Yandex Music에서 기존 15개 이상의 후보 생성기 및 랭킹 시스템을 단일 트랜스포머 모델로 대체한 추천 시스템 'Sona'의 개발 및 A/B 테스트 결과 요약.

  • 복잡한 다단계 추천 파이프라인(후보군 생성, 사전 랭킹, 랭킹)을 단일 엔드투엔드 트랜스포머 'Sona'로 통합했습니다.
  • 최대 8,192개 이벤트 처리에 따른 어텐션 비용을 줄이기 위해 히스토리 압축(History Compression) 기법을 적용하여 추론 비용을 약 절반으로 절감했습니다.
  • 스마트 스피커 대상 A/B 테스트에서 기존 상용 시스템 대비 활성 사용자 수와 총 청취 시간을 통계적으로 유의미하게 개선했으나, 카탈로그 커버리지는 다소 낮아졌습니다.
Notable Quotes & Details
  • Active Users +4.53%
  • Total Listening Time +6.30% (p < 0.01)
  • 8,192 events (older 6,144 events + recent 2,048)
  • 7 days, 15% of users in each arm
  • https://arxiv.org/abs/2608.11015

추천 시스템 엔지니어, 머신러닝 연구자, 검색 및 랭킹 시스템 개발자

I have trained a model to predict my blood sugar (Part 2) [P]

합성 데이터 시뮬레이터로 훈련된 경량 트랜스포머 모델을 활용해 개인의 실제 혈당 수치를 제로샷으로 예측하고 모바일 앱에 배포한 프로젝트입니다.

  • 1형 당뇨병(T1DM) 환자 시뮬레이터의 합성 데이터만으로 훈련된 31,251개 파라미터 규모의 인코더 전용 트랜스포머 모델을 개발했습니다.
  • 향후 2시간의 혈당을 예측하며 자기회귀(autoregressive) 방식을 통해 8시간 야간 예측 등 장기 예측 및 반사실적 추론이 가능합니다.
  • ExecuTorch 백엔드 기반 안드로이드 앱을 통해 Libre 3 plus, Anytime CT5, Linx 등 3개 CGM 기기의 최근 30일간 실제 데이터로 제로샷 성능을 검증했습니다.
Notable Quotes & Details
  • 31,251 parameters (16 layers, 1 attention head per layer, and a hidden dimension size of 16)
  • Training took <60 minutes on nvidia dgx spark
  • github.com/0xdeadf1sh/T1DMAI

헬스케어 AI 및 엣지 디바이스 머신러닝 개발자, 당뇨병 관리 기술에 관심 있는 개발자

Withdrawing an accepted paper before camera-ready due to zero funding? (ACML 2026 / OpenReview) [D]

학회 등록비와 출장비 지원 부족으로 인해 채택된 논문을 최종본 제출 전 철회하려는 연구자의 고민과 절차에 관한 문의입니다.

  • ACML 2026에 논문이 채택되었으나 등록비 및 여비 펀딩 부재로 최종본(camera-ready) 제출 마감 전 논문 철회가 불가피한 상황입니다.
  • OpenReview 플랫폼에서 직접 철회해야 하는지, 프로그램 의장단(Program Chairs)에 먼저 이메일을 보내야 하는지 올바른 절차를 문의하고 있습니다.
  • 공동 저자들과 함께 블랙리스트에 오를 위험이나 지연 철회 기록이 공개 아카이브로 남을 가능성 등 잠재적 불이익을 우려하고 있습니다.
Notable Quotes & Details
  • ACML 2026
  • OpenReview

인공지능 및 머신러닝 연구자, 대학원생, 학회 참가자 및 조직위원회

New forensic evidence supports Egyptian "retainer sacrifice"

1920년대 발굴된 고대 이집트 제1왕조 두개골 유골을 재분석한 결과, 둔기 외상의 흔적이 발견되어 순장 관행의 존재를 뒷받침하는 새로운 법의학적 증거가 제시되었습니다.

  • Frontiers in Environmental Archaeology 저널에 발표된 새 연구에 따르면 분석된 두개골의 3분의 1 이상에서 둔기 외상 흔적이 확인되었습니다.
  • 이번 발견은 초기 파라오들이 사후 세계에서 시중을 들게 하려고 시종과 관리를 함께 매장했다는 '순장(retainer sacrifice)' 가설을 뒷받침합니다.
  • 퍼듀 대학교의 생체고고학자 Roselyn Campbell은 식민주의적 관점을 벗어나 발전된 법의학 기술로 과거 유골 자료를 재맥락화하는 것이 중요하다고 강조했습니다.
Notable Quotes & Details
  • Frontiers in Environmental Archaeology
  • 1920s
  • over one-third show evidence of blunt force trauma
  • Roselyn Campbell: "People tend to fall into one of two camps... Either retainer sacrifice definitely happened, end of discussion, or it definitely didn't happen, end of discussion. But nobody's actually looked at the bones in a very long time."

고고학, 법의학, 고대 이집트 역사 및 인류학 연구에 관심 있는 대중과 연구자

How I made a paid Mac app in 11 days with Claude – without writing a single line of code

작성자가 직접 코드를 한 줄도 작성하지 않고 Claude를 활용한 바이브 코딩으로 11일 만에 유료 Mac 앱을 개발하여 App Store에 출시한 경험담입니다.

  • 단 한 번의 마법 같은 프롬프트가 아닌 502개의 지시어를 통해 직접 코딩 없이 Mac 앱을 완성했습니다.
  • 30년 전 제작했던 2,338개의 빈티지 아이콘 자산을 발굴하여 이를 현대적인 Mac 앱으로 재탄생시켰습니다.
  • 아이디어 구상부터 완성된 앱의 Apple 제출까지 일주일이 걸렸으며, 4일 뒤 최종 승인을 받아 출시되었습니다.
Notable Quotes & Details
  • 502 directives
  • Sept. 20
  • Sept. 27
  • 2,338 icons
  • 30 years ago
  • Vibe coding took 502 directives, not one magic prompt.

생성형 AI 및 Claude를 활용한 소프트웨어 개발, 노코드 및 바이브 코딩에 관심이 있는 개발자와 기획자

Akka Tests Spec-Driven AI Delivery Across 65 Open Source Projects

Akka가 65개 오픈소스 프로젝트를 대상으로 명세 기반 워크플로를 적용하여 AI 지원 소프트웨어 포팅을 실험하고 모델별 효율성과 성능을 분석했습니다.

  • Akka는 65개 오픈소스 프로젝트의 AI 포팅 실험에 99.3시간과 94.1억 개의 토큰을 투입했으며, 65개 중 57개 포팅에서 코드 라인 수 감소 또는 성능 개선을 달성했습니다.
  • 소형 모델인 Claude Sonnet은 포팅당 평균 61분이 소요된 반면 Opus는 120분이 걸렸으나 Opus가 토큰을 약 40% 적게 소비했고, 더 작은 모델이 즉흥적인 변형 없이 명세를 충실히 따르는 경향이 관찰되었습니다.
  • 애플리케이션·프레임워크·라이브러리 전반에서는 성능 개선이 나타났으나 인프라 및 툴링 분야에서는 성능 저하가 나타나는 등 프로젝트 유형별로 성능 차이가 컸습니다.
Notable Quotes & Details
  • The initial tranche took 99.3 hours and consumed 9.41 billion tokens, with Akka reporting a lines of code or performance improvement in 57 of the 65 ports.
  • Sonnet averaged 61 minutes per port versus 120 minutes for Opus, while Opus used about 40% fewer tokens.
  • Akka reported a 143,333 times improvement for Dify, but noted that the compared workloads differed, while Netflix Metaflow was approximately 100 times slower.

소프트웨어 엔지니어, AI 코딩 에이전트 도입을 검토 중인 테크 리드 및 개발자

Presentation: Building Reusable Evaluation Frameworks for Agentic AI Products

Elastic이 사일로화된 임시 AI 에이전트 평가 방식에서 벗어나 재사용 가능한 프로덕션급 통합 평가 프레임워크를 구축한 사례를 소개합니다.

  • LLM 심사위원(LLM-as-a-judge) 방식과 결정론적 규칙(deterministic rules)의 균형을 맞춘 평가 구조를 설계했습니다.
  • Python 기반의 데이터 과학 평가 코드와 TypeScript 프로덕션 환경 간의 간극을 연결하고 심층 추적(deep tracing)을 적용했습니다.
  • 복잡한 RAG 및 사이버 보안 워크로드에서 도메인 컨텍스트를 유지하면서 회귀(regression) 현상을 방지하도록 지원합니다.
Notable Quotes & Details
  • Susan Chang: My name is Susan. I'm a principal data scientist at Elastic.

AI 에이전트 및 LLM 기반 프로덕션을 개발·평가하는 엔지니어와 데이터 과학자

Article: The Platform Engineering Playbook for Production LLMs

LLM을 프로덕션 환경에 배포할 때 파운데이션 모델 자체를 변경하지 않고도 플랫폼 엔지니어링 설계를 통해 환각률을 대폭 낮추고 안정성을 확보한 실전 사례를 소개합니다.

  • 포맷팅·접지·인프라 오류를 실시간으로 처리하는 자동 재시도 루프와 의도 검증 게이트를 도입하여 프로덕션 환각률을 15%에서 1.5%로 대폭 축소했습니다.
  • 프롬프트를 코드에 하드코딩하지 않고 히스토리 기반 레지스트리에 저장하여 런타임에 즉시 롤백 및 업데이트할 수 있는 체계를 구축했습니다.
  • API 게이트웨이에만 의존하지 않고 리소스 서버 수준에서 기본 거부(default-deny) 원칙의 도구 인가를 적용해 보안 취약점 전파를 방지했습니다.
Notable Quotes & Details
  • 환각률을 15%에서 1.5%로 축소 (cut production hallucination rate from fifteen percent to 1.5 percent without touching the foundation model)
  • 기본 거부 정책 적용 (strict default-deny policy)
  • llama3.1 via Ollama, LiteLLM, Gemini, GPT

LLM 기반 시스템을 프로덕션에 구축 및 운영하는 플랫폼 엔지니어, 소프트웨어 엔지니어, AI 시스템 아키텍트

⚡ Weekly Recap: NetScaler and FortiMail 0-Days, AI Coding Leaks, Spectre v2 and Ransomware Arrests

NetScaler 및 FortiMail의 제로데이 취약점 악용 사례와 주요 랜섬웨어 조직원들의 체포 소식을 다룬 주간 보안 동향 요약입니다.

  • 시트릭스는 표적형 제로데이 공격에 악용된 NetScaler ADC 및 Gateway의 고위험 메모리 오버플로우 취약점(CVE-2026-88779)에 대한 보안 업데이트를 배포했습니다.
  • CISA는 인증되지 않은 공격자가 임의의 파일을 쓸 수 있는 Fortinet FortiMail의 치명적인 제로데이 취약점(CVE-2026-104286)이 실제 공격에 악용되고 있다고 경고했습니다.
  • 사법 당국은 디지털 갈취 조직 ShinyHunters 소속 조직원 2명과 KillSec 랜섬웨어 조직을 이끈 16세 주동자를 각각 체포했습니다.
Notable Quotes & Details
  • CVE-2026-88779 (CVSS: 8.7/10.0)
  • CVE-2026-104286 (CVSS: 9.8)
  • 2026년 9월 30일 KillSec 유출 사이트 압류 및 110 테라바이트(TB) 데이터 확보
  • KillSec 조직은 2024년 등장 이후 약 1,000건의 공격을 감행했으며 최소 절반이 성공한 것으로 추정

보안 담당자, IT 인프라 관리자, 사이버 위협 인텔리전스 분석가

구글, 'AI 프로' 국내 한정 40% 할인...연간 구독권 프로모션 진행

구글이 한국 이용자를 대상으로 '구글 AI 프로' 연간 구독권을 40% 할인하는 프로모션을 진행하고 주요 고급 기능 및 캠페인 영상을 공개했다.

  • 구글이 10월 31일까지 국내 신규 연간 구독자를 대상으로 기존 29만 원에서 40% 할인된 17만4000원(월 환산 1만4500원)에 '구글 AI 프로'를 제공하는 프로모션을 진행한다.
  • 구글 AI 프로 요금제는 5TB 스토리지와 함께 '딥 리서치', 개인 AI 에이전트, 워크스페이스 연동, '안티그래비티', '제미나이 옴니' 등 프리미엄 기능을 제공한다.
  • 구글은 오는 9일부터 무료 및 일부 저가 요금제에서 '제미나이 프로' 모델 제공을 중단하는 대신, AI 프로 요금제에 '딥 싱크(Deep Think)' 등 심층 추론 기능을 강화해 서비스 차별화를 꾀한다.
Notable Quotes & Details
  • 10월31일까지 ‘구글 AI 프로’ 연간 구독권을 40% 할인된 가격으로 구매할 수 있다.
  • 기존 연간 플랜 요금인 29만 원에서 40% 할인된 17만4000원(월 환산 1만4500원)
  • 오는 9일부터 무료 및 일부 저가 요금제 서비스에서 '제미나이 프로' 모델 제공을 중단할 예정
  • 구글 관계자: “구글 AI 프로는 복잡하고 방대한 정보 탐색부터 일상 속 반복적인 워크스페이스 업무 자동화에 이르기까지, 이용자의 시간과 노력을 획기적으로 줄여주는 가장 강력한 개인 AI 파트너”

생산성 향상 및 심층 연구·업무 자동화를 위해 생성형 AI 구독 서비스를 고려 중인 국내 일반 이용자, 직장인, 개발자

클로드, 18개 분야 36편 논문 원고 작성… 앤트로픽이 조명한 AI 과학 연구

하버드대 매슈 슈워츠 교수가 클로드와 오픈소스 하네스 시스템 '부트룹스'를 활용해 18개 분야에서 36편의 논문 원고를 작성하며 AI 기반 과학 연구의 새로운 협력 모델을 제시했다.

  • AI와 과학 연구 현장 사이의 '임피던스 불일치'를 해결하기 위해 LLM의 강점에 최적화된 '클로드형 문제'를 정의하고 오픈소스 하네스 시스템인 '부트룹스(BootLoops)'를 구축했다.
  • 물리학의 파인먼 다이어그램 계산 도구를 집단유전학, 생태학, 경제학, 언어학 등 다양한 학문 분야로 확장하여 오랜 미해결 방정식들을 해결하고 대규모 검증을 수행했다.
  • AI의 환각과 가치 판단 부재를 인간 연구자의 방향 제시로 보완함으로써 AI가 과학자의 대체재가 아닌 지식의 빈틈을 메우는 협력자임을 입증했다.
Notable Quotes & Details
  • 3개월간 클로드와 함께 400여개의 후보 문제를 검토했으며, 19명의 공동 연구자와 협력해 18개 분야에서 총 36편의 논문 원고를 작성했다.
  • 슈워츠 교수가 수주에 걸쳐 작성했던 코드를 클로드는 약 20분 만에 재현했을 뿐만 아니라 더 효율적인 알고리즘까지 제안했다.
  • 20년간 실제 데이터 규모로 풀지 못했던 람팔 에티엔의 중립 이론 방정식을 계산해 냈다.
  • 상위 5개 경제학 학술지 논문 4452편의 재현 패키지를 검증
  • 6072개 언어의 악센트 체계를 정리한 데이터베이스 'AccStack'을 구축
  • 클로드는 광범위한 계산을 주도할 수 있지만, 정작 무엇이 흥미롭고 과학적으로 중요한지 판단하는 가치 기준은 여전히 인간 연구자가 제시해야 한다

AI를 연구에 활용하고자 하는 과학자 및 연구원, 프론티어 AI 모델의 학술적 응용에 관심 있는 기술 연구자

앤트로픽, 10월6일까지 '음성 인터뷰어' 가동…대화록 공개·음성 학습 수집 결합

앤트로픽이 대화형 AI 연구 에이전트 '앤트로픽 인터뷰어'를 확대 가동하여 사용자 인터뷰 대화록 공개와 음성 모델 학습용 데이터 수집을 진행하고 있다.

  • 앤트로픽이 일반 클로드 및 클로드 코드 사용자를 대상으로 15분 분량의 대규모 질적 인터뷰 연구를 가동했다.
  • 응답자가 인터뷰 종료 후 익명화된 전체 대화록의 외부 공공 데이터 공개 여부를 직접 선택할 수 있도록 데이터 공개 범위를 확대했다.
  • 음성 인식 및 응답 성능 향상을 위한 학습용 음성 데이터 수집 동의가 병행되는 가운데, 익명화 데이터의 재식별 가능성에 따른 프라이버시 노출 우려가 제기되고 있다.
Notable Quotes & Details
  • 9월29일부터 10월6일까지
  • 15분간 진행되는 인터뷰
  • 2025년 12월 처음 등장
  • 당시 8만명 이상의 비공개 인터뷰
  • 소액의 비용만으로 응답자 신원을 재식별할 수 있다는 연구 결과

AI 연구자, 정책 입안자, 클로드 사용자 및 데이터 프라이버시에 관심 있는 일반 대중

KAIST, 데이터 변화해도 검색 정확도 유지하는 ‘CONDA’ 기술 개발

KAIST 연구진이 데이터의 잦은 추가와 삭제 시에도 경로 연결성을 유지해 검색 정확도와 속도를 높이는 동적 벡터 검색 기술 'CONDA'를 개발했다.

  • 데이터가 계속 변경될 때 벡터 검색망의 경로가 끊어지는 '연결성 붕괴' 문제를 해결하기 위해 동적 벡터 검색 기술 'CONDA'를 개발함
  • 연결성 고려 검색 경로 선택(CRNG), 새 데이터 연결 보강, 효율적인 지연 삭제(Lazy Deletion) 등 3가지 핵심 기술을 통해 경로 고립을 방지하고 업데이트 비용을 절감함
  • 1억 개 대규모 데이터 실험에서 기존 대비 검색 정확도 최대 24.5%, 처리 속도 최대 1.90배 향상을 달성했으며, 그래파이의 '아카식DB'에 적용되어 올해 4분기 상용화 예정임
Notable Quotes & Details
  • 기존 최신 기술 대비 검색 정확도 최대 24.5% 향상
  • 데이터 처리 속도 최대 1.90배 향상
  • 1억 개의 데이터가 존재하는 대규모 환경에서 6시간 동안 검색 및 데이터 업데이트 동시 수행 테스트 완료
  • 올해 4분기 상용화 예정

AI 및 RAG 시스템 개발자, 데이터베이스 엔지니어, 대규모 검색 서비스 기획자

GPT-6 아스트라, 217년 된 나폴레옹 암호 6시간 만에 해독

오픈AI의 GPT-6 아스트라가 217년 동안 미해결 상태였던 나폴레옹 시대의 군사 암호를 단 6시간 만에 스스로 해독하는 데 성공했습니다.

  • 센티넬원의 엔지니어 카터 처치가 GPT-6 아스트라에 단 한 장의 이미지와 프롬프트만 입력해 1809년 프랑스군 군사 암호를 약 6시간 만에 해독했습니다.
  • 아스트라는 기호 전사, 구조 분석, 외부 역사 문헌 자율 검색 및 대조, 자체 시뮬레이티드 어닐링 해독기 실행 등 전체 작업 흐름을 독자적으로 완수했습니다.
  • 이번 해독을 통해 '나폴레옹 1세 서간집'의 끊겨 있던 문장이 복원되었으며, 크립티아나 운영자 도모키요 사토가 해독 결과를 공식 확인했습니다.
Notable Quotes & Details
  • 217년 동안 풀리지 않았던 나폴레옹 시대의 군사 암호
  • 단 6시간 만에 해독
  • 155개의 서로 다른 기호와 1300여 개의 치환 단위
  • 카터 처치: "아스트라가 단일 이미지와 목표만 입력받아 약 6시간 만에 전체 멀티모달 작업을 완료한 것이 인상적"
  • 카터 처치: "모든 분야에는 전문가들이 시간과 자원 부족으로 해결하지 못한 틈새 문제들이 쌓여 있다... 앞으로 이런 미해결 목록을 줄이는 사람들은 단순히 호기심을 가진 외부인이 될 가능성이 커질 것"

AI 기술 발전 및 멀티모달 추론 역량, 역사학·암호학 연구에 관심 있는 개발자 및 일반 독자

Jooojub
System S/W engineer
Explore Tags
Series
    Recent Post
    © 2026. jooojub. All right reserved.