Ivan Begtin


Kanal geosi va tili: Armaniston, Ruscha


I write about Open Data, Data Engineering, Government, Privacy, Digital Preservation and etc.
CTO&Founder of Dateno https://dateno.io
Telegram @ibegtin
Facebook - https://facebook.com/ibegtin
Email ivan@begtin.tech
Ads/promotion agent: @k0shk

Связанные каналы  |  Похожие каналы

Kanal geosi va tili
Armaniston, Ruscha
Statistika
Postlar filtri


Многие пишут про ox-alpha "скрытую" модель на OpenRouter где не указано кто её создатель, но можно моделью бесплатно воспользоваться. Много разных есть догадок о том кто за ней стоит и кто бы это не был - это неплохой, но, явно, очень дорогой маркетинг. Сейчас все бросились её тестировать и писать о ней, а потом все начнут писать о том кто же за ней когда создатель всплывёт наружу.

И напишут потому что модель вполне себе качественно работает как минимум на задачах кодирования, анализа и работы с данными. По субъективным ощущениям не хуже GLM-5.3, а может и даже лучше.

#ai #datatools


OECD AIS Report визуализация данных о морских перевозках от ОЭСР.

Плюсы:
- наглядная визуализация на карте и в графиках
- детализация данных до портов и перевозимых продуктов по типам
- относительно небольшой лаг в 3 месяца (в августе данные на май 2026г.)

Минусы:
- нет нормально доступных данных, только экспорт выборок в Excel
- не все страны есть, к примеру есть данные по России и нет данных по США
- все таки 3 месяца это большой лаг, для оперативного анализа

Что хорошо, можно легко автоматизировать выгрузку данных даже если там только Excel и тд. Недокументированное API тоже есть.

#opendata #datasets #oecd


Ещё немного рассуждений вслух про то как публикуются данные в мире сейчас:
1. Порталов открытых данных становится больше преимущественно за счет национальных порталов развивающихся стран и муниципальных каталогов данных.
2. В Евросоюзе больше муниципальных порталов именно открытых данных, в США больше порталов геоданных на базе ArcGIS Hub иногда совмещенных с порталами открытых данных.
3. Более всего и чаще всего на порталах данных публикуют официальную статистику, геоданные и данные финансовой отчетности (бюджеты, расходы по проектам, контракты и тд.)
4. Практически все университеты где есть наука имеют свои порталы раскрытия данных или разделы на порталах публикации научных результатов. Иногда таких порталов несколько и аналогичная ситуация со всеми живыми научными центрами. Много таких порталов раскрытия результатов появляется в университетах развивающихся стран
5. Россия уникальная 3-мя факторами. 1) Порталов открытых данных становится не больше, а меньше. 2) Почти все публикуемое государством - это мелкие административные данные. Бесполезные в работе. 3) Публикация научных данных скорее редкость чем активный тренд. Большая часть данных российских ученых публикуется напрямую на международных платформах, а не на ресурсах исследовательских центров и университетов.
6. Многие каталоги данных в мире остаются за геоблокировками: Россия, Китай, Вьетнам как наиболее заметные примеры.
7. Все больше блокировок краулеров, преимущественно через Cloudflare и другие CDN. Это ограничивает к ним доступ и для поиска, и для применения ИИ агентов.
8. Очень много локальных игроков создающих геоинформационные системы, но почти всегда на бэкэнде у них используется ArcGIS Server или Geoserver или один из более древних open-source движков.

#thoughts #data #datacatalogs


Цифровой архив госфинансов и госуправления dan repost
Из коллекции Цифрового архива: «Государственный бюджет СССР и бюджеты союзных республик 1950, 1955, 1960–1965 гг. Статистический сборник», Москва, 1966 г.

Во второй половине XX века бюджетная система СССР приобрела свой окончательный вид. Она объединила в себе бюджеты всех уровней государственного управления. Так, государственный бюджет СССР включал в себя собственно союзный бюджет, которым распоряжалось союзное правительство, и бюджеты союзных республик, которыми распоряжались республиканские правительства. Бюджеты союзных республик в свою очередь делились на бюджет республики и на местные бюджеты отдельных областей, краев и автономий. В свою очередь, они делились на региональный бюджет и бюджеты отдельных городов и районов.

Такая структура получила свое отражение и в статистических справочниках Министерства финансов СССР, которые выпускал отдел финансово-экономической статистики Бюджетного управления. Справочники выходили в свет последовательно и имели единую структуру. Это не только сделало их надежными источниками информации о доходах и расходах бюджета СССР за столь продолжительный период, но и упростило преобразование числовых данных в современные машиночитаемые наборы данных.

В Цифровом архиве представлены такие справочники за период 1950–1985 годов, и таблицы двух из них полностью преобразованы в формат CSV и доступны для скачивания.

Рассмотрим, например, справочник, содержащий данные за 1950, 1955, 1960–1965 годы. Показатели в нем отражают фактические доходы и расходы государственного бюджета СССР и республиканских бюджетов. Эти сведения детализированы до уровня направлений расходов и доходов.

Первый раздел — «Государственный бюджет СССР» — дает общий обзор доходов и расходов союзного бюджета, которые распределены по основным разделам и показаны в абсолютном и процентном выражении. Здесь приведены также суммы разных видов доходов по союзному бюджету и бюджетам республик и расходы по различным направлениям в городах, рабочих поселках и сельской местности.

Основная часть второго раздела — «Государственные бюджеты союзных республик» — состоит из 15 комплектов таблиц (по одному на каждую республику), в каждый из которых входят:

• Доходы республики (в млн. рублей).
• Расходы республики (в млн. рублей) и продолжение таблицы с группировкой по основным видам затрат.
• Структура расходов в процентах и аналогичная группировка по видам затрат.
• Распределение расходов по видам местных бюджетов.

Кроме того, во втором разделе опубликованы росписи основных видов затрат для различных социально-культурных мероприятий, а также данные бюджетов АССР.

Аналогичные по структуре и наполнению справочники есть для следующих периодов:

• 1966–1970 гг.
• 1971–1975 гг.
• 1976–1980 гг.
• 1981–1985 гг.

При этом данные для 1950–1970 годов уже полностью преобразованы в формат CSV. Команда Цифрового архива продолжает преобразование таблиц из этих справочников в машиночитаемый формат.

Справочники можно скачать на сайте Цифрового архива:

Годы 1950, 1955, 1960–1965
Годы 1960, 1965, 1966–1970
Годы 1966–1970, 1971–1975
Годы 1971–1975, 1976– 1980
Годы 1976–1980, 1981–1985

В ближайших публикациях покажем несколько датасетов, подготовленных на основе таких справочников.

#бюджет #СССР #ЦАГГ #данные #доходы #расходы #статистика


В рубрике как это устроено у них свежие порталы открытых данных африканских стран

Того - https://opendata.gouv.tg
Работает на базе ПО uData, французского open source проекта. Содержит более 1500 наборов данных. Преимущественно в формате CSV и много геоданных

Ливия - https://opendata.gia.gov.ly/
Работает на базе открытого ПО CKAN. Включает 129 наборов данных. В основном это файлы Excel, некоторые статпоказатели также публикуют в CSV и JSON

#opendata #datasets #data #libya #togo #africa


Рассеянные мысли вслух:
1. Почему создание своей платформы для кода логичный ход для Cursor и почему этого стоит ждать и от других игроков. Потому что де-факто у Microsoft монополия в виде GIthub'а и в какой-то момент плотность работы ИИ агентов с платформой достигнет того уровня что MS начнут взимать с компаний разработчиков кодирующих ИИ ассистентов плату за быстрый доступ (странно если ещё не взимают, может я пропустил что-то).
2. Последние ИИ инструменты уже лучше меня умеют в обнаружение каталогов данных. Это сложный был скилл который я подумывал описать и передать кому-то в команде или найти под это отдельного человека. Но сейчас с помощью последних ИИ агентов gpt-5.6-sol, fable-5 и grok-4.6 меня можно заменить. Они реально умеют находить лучше чем я, и если я знаю несколько больше про глубину поиска и анализа, то по ширине охвата и скорости уже не могу сравниться. Что это значит? Что я сам могу делать эту работу значительно лучше и что принципиально меня теперь можно заменить. Не роботом, но аналитиком + ИИ ассистентом.
3. Водяные знаки генерируемые Anthropic'ом - это не только потенциальный инструмент отслеживания их компьютерной генерации, но цифровая маркировка позволяющая отслеживать конкретный цифровой объект (текст) и создавшего его пользователя. Это не просто механизм соблюдения требований регулятора, но и, потенциально, инструмент отслеживания.

#thoughts #aiagents


В продолжение моих рассуждений про дата-продукты и их отличие от наборов данных. Пример публикации таких дата продуктов в академической среде это портал Портал исследовательских данных Шотландии researchdata.scot. Там всего 133 базы данных и это не данные опубликованные исследователями в рамках научных работ, а базы данных доступные исследователям, преимущественно по запросу.

Там немного другая структура описания этих дата продуктов и оно включает:
Summary - сводная информация
Documentation -
документация и описание
Coverage -
область покрытия географическая и временная
Provenance -
происхождение, источник и тип данных
Access and governance -
доступ и управление, как получить доступ к данным, условия, владелец и контакты
Enrichment and linkage -
связанные наборы данных, инструменты для работы, как их интегрировать с другими
Synthetic data -
синтетические данные
Data dictionary
- справочники и словари ассоциированные с этими данными

Тут надо оговориться что это речь про исследовательские дата продукты, а не про коммерческие/корпоративные. Поэтому эта структура и подача даже слегка консервативна, но вполне логична и куда более ложится в логику дата продуктов.

Для сравнения можно посмотреть на дата продукты для финансового сектора в Nasdaq Data Link data.nasdaq.com

Кроме всего прочего там ключевыми характеристиками являются:
- частота обновления данных и частота их доставки
- период задержки

А также множество инструментов доставки и, в виду, особенностей потребления данных акцент на API.

#opendata #data #dataproducts #datacatalogs


О том как в Китае работают с данными, текст комиссии Конгресса США. Общий смысл текста в том что у властей Китая есть чему поучиться, а по содержанию там речь про системы обмена/продажи данных в Китае в виде data exchanges и много подробностей, например, то что Минфин Китая рассматривает базы данных (data assets) как объекты учета.

#data #china


Все регулярнее читаю тексты которые можно описать как "Открытому коду конец" иногда прямо так и называющиеся. Не буду предсказывать за весь открытый код, но кое что можно сформулировать. Многие код перестанут открывать и что-то закроют потому что пропали две ключевых причины почему многие компании/корпорации код выкладывали:
1) Получить бесплатных контрибьютеров в продукт
2) Получить бесплатный анализ безопасности и выявления ошибок

Теперь контрибьюторами будут ИИ агенты и они же будут делать проверки безопасности. Так зачем открывать код? Не, есть и другие причины вроде построения сообщества, прозрачности деятельности, идеологии и тд. Но они имеют меньшее влияние.

#opensource #thoughts


Я регулярно пишу про кризис в сообществе открытых данных из-за развития LLM. Главный источник кризиса в том что у открытых данных да и вообще у любых доступных данных появились компании которые умеют профессионально их монетизировать, хотя инфраструктура проектов с данными создается волонтерами, поддерживается на гранты и так далее.

Вот тут свежий документ-письмо сообщества DPG - Best Practices for Preventing AI Exploitation of Open Content and Open Data DPGs.

Иначе говоря на повестке сообщества не в том как больше открыть данные, а как разделить потребителей на коммерческих и некоммерческих. Там список технических, юридических и управленческих мер по ограничению ботов скрейперов, указанию лицензий использования, условий использования и так далее.

Важный документ отражающий общие настроения которые можно изложить как "мы работаем бесплатно, а на нас зарабатывают миллиарды долларов".

Отдельный вопрос в том что это кризис открытости в целом, не только данных, но и кода, свободно распространяемых текстов и так далее.

#opendata #ai

1.1k 1 11 12 25

Дата_продукт_—_больше,_чем_данные.pdf
1.2Mb
Завтра я читаю внутреннюю лекцию про дата продукты, к которой набросал вот такую презентацию. Понятно что презентация просто иллюстрация к речи, но основные смыслы в ней есть. Покидайте в меня критики / замечаний / комментариев по содержанию. Что так и что не так

#questions #data #dataengineering

1k 2 25 3 15

4CIO: чат свободного сообщества dan repost
Перестаньте угадывать, куда движется цифра — спросите тех, кто её рулит.

Школы МГИМО и МФТИ — это объединение двух совершенно разных миров: сухой технологической экспертизы Физтеха и масштабного бизнес-мышления МГИМО.

Если вы переросли линейный менеджмент и хотите вести за собой цифровые проекты, этот вечер — ваша персональная разведка.

Зачем вам приходить 26 августа:

* Жёсткий «профтест» спикеров. Вы лично увидите тех, кто ведет дисциплины — от директоров по цифровой трансформации крупного бизнеса до IT-практиков Физтеха. Поймёте за 15 минут, дают ли они свежую фактуру или читают по бумажке.
* Калибровка своего кейса. Сможете прямо в кулуарах спросить академических руководителей: *«У меня такой-то опыт и такие задачи. Окупится ли мне эта программа?»*
* Оценка будущего окружения. На MBA половину ценности формируют однокурсники. Посмотрите на тех, кто будет сидеть с вами за одной партой — это действующие мидл- и топ-менеджеры не младше 25 лет.
* Понимание реальных результатов. Выпускники программы не просто получают два диплома — они забирают связи и пересобирают свои карьерные треки в ритейле, финтехе и госсекторе.

Приходите задать неудобные вопросы, оценить уровень экспертов и понять, стоит ли эта инвестиция вашего времени.

Когда: 26 августа (среда), 19:00

Где: Москва, Климентовский пер., д. 1, стр. 1 (актовый зал)

👉 [Зарегистрироваться на встречу](https://forms.yandex.ru/u/6a664f28493639bf35c66bbe)

*Вход бесплатный, но требуется предварительная регистрация.*

Подробная программа и спикеры — на [digital.mgimo.ru](https://digital.mgimo.ru)
 
Подробности: https://digital.mgimo.ru
 
*минимальный возраст слушателей - 25 лет


Много, очень много документации лишней не бывает. Я собрался и актуализировал документацию по разным инструментам. Без ИИ ассистентов делать такое почти невозможно, ибо заставить себя документировать сложно. А документация нужна и для людей и для ИИ агентов которые ее используют.

Итак вот тут документация на разные открытые инструменты о которых я тут часто писал:
- internacia-db - база данных в виде дата продукта по странам и межгосударственным организациям
- iterabledata - универсальная библиотека для Python для унифицированного чтения из 100+ видов дата файлов
- undatum - инструмент командной строки, швейцарский нож для работы с данными причем не только с табличными, а такими как JSONL, Parquet и тд. Поддерживает более 140 форматов файлов и помогает анализировать, конвертировать и преобразовывать файлы с данными
- newsworker - утилита и библиотека по извлечению RSS, Atom и JSON новостных лент из HTML с сайтов где нет своих новостных лент в структурированном виде
- filerepack - утилита переупаковки файлов без потерь содержания и фунциональности. Умеет пересжимать слабо сжатые файлы, сжимать файлы внутри контейнеров, сжимать сами контейнеры, поддерживает изображения, файлы архивов, файлы с данными и так далее.
- qddate - библиотека для Python для быстрой идентификации и парсинга дат
- metacrafter - инструмент автоматической идентификации семантических типов данных в файлах с данными и СУБД. Умеет экспортировать результаты для загрузки в дата каталоги
- metawarc - утилита для индексации и работы с WARC файлами современными методами. Преобразует данные WARC в файлы Parquet и умеет извлекать метаданные вложенных в WARC файлов
- apibackuper - утилита извлечения и архивации данных извлекаемых из API. Изначально делалась для задач архивации, реально применяется для всех задач автоматизации извлечения данных из API
- datacrafter - очень простой NoSQL ETL инструмент использующий наработки iterabledata и и ориентированный на работу с JSONL и подобными данными

У меня скорее хобби поддерживать эти инструменты, ну и многие интегрированы в продукты и проекты которые без открытого кода. Хорошо что поддержание их стало очень простым благодаря применению кодирующих ИИ агентов.

А документация поможет тем кто хотел бы узнать больше о том как они работают и для чего применимы.

#opensource #datatools #dataengineering


Полезные ссылки про данные, технологии и не только:
- ClickBench playground рассказ о том как устроен сервис запросов к более чем сотне разных баз данных используемых в бенчмарке ClickBench. И сам бенчмарк очень интересный как сравнение многих СУБД, и игровая площадка полезная
- A Preview of DuckDB v2.0 изменения в DuckDB, то что войдет в версию 2.0. Ключевое это новый парсер SQL, новый формат хранения, серверный вариант, ускорение запросов и еще много всего.
- fx кодирующий агент ориентированный на исследования и встраивание
- Cursor Origin хостинг кода от Cursor'а. Очень логичный шаг, странно что только они из кодирующих агентов такое начали. Думаю что остальные подтянутся. Альтернативы Github'у - это хорошо. А вот складывать все яйца в одну корзину лучше не надо.

#opensource #ai #databases


Как я и писал ранее удалось сильно улучшить обнаружение каталогов данных и вышла новая версия реестра каталогов данных. В нее вошло:
- плюс 1748 новых каталогов данных, это более 12% от общего числа, иначе говоря очень много. Среди добавленных каталогов много геопорталов, инсталляций CKAN в Индонезии и Таиланде, китайских порталов научных данных, порталов данных по биоразнообразию, порталов микроданных переписей и так далее.
- 12 новых типов программных продуктов на которых делаются каталоги данных: oportal, piveau, knoema, redatam, datafair и другие
- исправления и улучшения в метаданных существующих описания каталогов данных

Из явных находок:
- картографический сервис ewmapa в Польше на базе которого есть сайты для всех муниципалитетов
- шведская специфика, почти все порталы открытых данных на базе их местного продукта EntryScape
- китайские научные порталы данных почти все работают на базе Instdb, ПО Китайской Академии Наук, их много прибавилось
- NextGIS Web массово используется по всему миру, много инсталляций за пределами РФ добавилось в реестр
- оказывается data.europa.eu создан на базе open source каталога данных Piveau, я все это время думал что там своя разработка

И еще немного цифр:
- 5,906 всех каталогов данных в Европе - это 36.3% от общего числа
- 4,619 всех каталогов данных в США - это 28.4% от общего числа

В Европе страна с наибольшим числом каталогов данных Франция - 801
В США более всего каталогов данных находится в Калифорнии - 481

Подробнее в CHANGELOG, код и данные в репозитории

#opendata #datacatalogs


Новый бенчмарк DataBench LLM для аналитичекской работы с данными от Hex. Вот тут они подробно рассказывают про то как он работает. Ожидаемо хорошие результаты у Fable 5, и самые дорогие, конечно же, по стоимости. Сравнивают, в основном, модели из США от OpenAI и Anthropic. Из китайских там только Kimi 2.7, хотя уже вышла Kimi K3, хотелось бы посмотреть сравнение с ней, и с GLM-5.3

#data #aiagents


В продолжение про обновление реестра каталогов данных Dateno, поделюсь ещё наблюдением то что модели внутри Cursor'а и выполнение задач агентами стало, в некоторых задачах, сравнимо с внешними аналитическими ИИ агентами вроде Manus'а. Например, в рамках ведения этого реестра самая сложная часть - это поиск новых каталогов данных. В какой-то момент все "низковисвящие фрукты" сорваны и надо целенаправленно искать новые каталоги данных чтобы их добавлять. А можно было отправить задачу в тот же Manus или другие размышляющие ИИ агенты с deep research и wide research в стиле "Найди мне дата каталоги по такой-то стране/такой-то тематике" и далее найденное уже добавлять в реестр.

Сейчас ИИ агенты для кодинга справляются с этой задачей если не лучше, то сравнимо. Поиск отсутствующих дата порталов по странам и по предметным областям приводит к формированию краткого отчета в котором практически всегда есть упущенные ранее каталоги данных.

Это хорошее открытие, позволяющее из интерфейса того же Cursor'а искать новые каталоги данных и меньше использовать внешние сервисы, у которых меньше контекста. Скорее всего благодаря этому я довольно скоро существенно обновлю реестр каталогов данных по многим странам.

#opendata #datacatalogs


В мире есть всего 3 страны в которых нет ни одного портала данных - это Северная Корея, Сент-Китс и Невис и Гренада. Это не значит что никаких данных о них нет, есть данные межгосударственных структур которые собирают данные по всем странам, но вот конкретно в этих случаях сами страны публикуют информацию очень скудно. В этом списке мог бы быть Туркменистан, но там есть хотя бы портал показателей устойчивого развития sdg.stat.gov.tm в остальном же тоже все очень скудно.

У 43 стран нет национальных каталогов статистических индикаторов. Не сайтов статслужб с публикациями в PDF/Excel, а именно каталогов с индикаторами/временными рядами. Большая часть этих стран - это малые страны Карибского моря, Океании и другие беднейшие страны. Что характерно почти у всех стран Африки есть порталы статпоказателей в рамках проекта Африканского банка развития.

У 82 стран нет национальных порталов открытых данных, из европейских стран это только Андорра, Сан Марино и Беларусь. У большей части стран Океании и Африки также нет национальных порталов открытых данных. В ряде стран вроде Пакистана то что официально так называется де-факто этим не является.

Всё это цифры на основе последнего релиза dataportals-registry реестра каталогов данных Dateno. Там был добавлено 92 новых каталога данных и обновлены метаданные существующих. Например, национальные порталы открытых данных в этом году появились у таких стран как:
- Бутан - data.gov.bt
- Иордания - opendata.gov.jo
- Камбоджа - data.mef.gov.kh
- Лихтенштейн - opendata.li
- Монако - data.gouvernement.mc
- Оман opendata.gov.om

#opendata #datacatalogs #data


В рубрике как это устроено у них Национальный портал открытых данных Пакистана nodp.gov.pk. Называется громко, а по факту это портал со статистикой, причем не для выгрузки, а в виде дашбордов в Superset выставленных онлайн. Данные из дашбордов можно, конечно, скачать в CSV или XLS, но это не отменяет того что это портал с дашбордами и название де-факто не соответствует содержанию. Зато хорошо иллюстрирует мои рассуждения про дата продукты и про то что ими является и что нет. Вот тут дата продуктов не то чтобы нет, нет даже намека на них. Для развивающихся стран это частая история когда делают портал с небольшим числом статистических показателей и называют его порталом открытых данных.

#opendata #statistics #pakistan #datacatalogs


В Reuters статья о том что Госдепартамент США потребовал у стран определиться в какой из глобальных ИИ инициатив они участвуют - в Pax Silica или WAICO. Я чуть менее месяца назад писал об этом же, что эти две инициативы словно создают новых двух полярный мир и единственная страна которая сейчас пытается усидеть на двух стульях - это Казахстан, но думаю что тут США надавят. Интересно уже даже появится ли на фоне этого своеобразное движение цифрового неприсоединения, участники которого будут де-факто отказываться от участия в обеих этих инициативах? В любом случае чем дальше тем больше вокруг ИИ будет завязано геополитики и страсти накаляться по мере применения основанных на них инструментов в военных целях, кибербезопасности, террористами и так далее.

#ai #geopolitics #usa #china

20 ta oxirgi post ko‘rsatilgan.